「大模型技术」共找到 10342 篇相关文章
CAIR开源发布超声基座大模型EchoCare“聆音”,10余项医学任务性能登顶
2025年9月17日,CAIR开源发布超声基座大模型EchoCare“聆音”。它基于超450万张影像数据集训练,在10余项医学任务测试中表现卓越。首创结构化对比自监督学习框架,为AI医疗应用提供创新路径。
Andrej Karpathy 爆火演讲刷屏技术圈:AI 开启软件 3.0,重写一切的时代来了!
Andrej Karpathy 在旧金山 AI 创业学校演讲,指出 AI 开启软件 3.0 时代,自然语言成编程接口。软件经历 1.0 代码、2.0 神经网络权重,现进入 3.0 用提示词编程大模型阶段,还探讨大模型特性、应用及相关问题。
让大模型合成检查器:UIUC团队挖出Linux内核90余个长期潜伏漏洞
伊利诺伊大学香槟分校张令明老师团队的论文提出KNighter,它让大模型生成静态分析检查器,在Linux内核挖出92个长期潜伏漏洞,将LLM归纳能力沉淀为规则,带来可落地等好处。
清华姚班团队,开源具身智能视觉语言动作(VLA)模型工具箱,打造行业通用技术底座
清华姚班团队所在的原力灵机公司,开源了基于PyTorch的视觉语言动作(VLA)模型工具箱Dexbotic。它能打造通用底座,解决行业研发困境,其预训练模型表现出色,还与Hugging Face合作推出评测平台。
不靠海量数据,如何精准喂养大模型?上交Data Whisperer:免训练数据选择法,10%数据逼近全量效果
上海交通大学等团队提出 Data Whisperer,首个免训练的注意力驱动数据选择框架。它利用模型自身能力打分挑数据,无需训练与人工标注,用 10% 数据让微调效果逼近全量数据,在多方面领先传统方法。
DeepSeek-V3再发论文,梁文锋署名,低成本训练大模型的秘密揭开了
DeepSeek 发布围绕 DeepSeek-V3 的技术论文,从硬件架构和模型设计双重视角,探讨实现经济高效的大规模训练和推理的方法。介绍了 DeepSeek-V3 的创新设计,如 DeepSeekMoE 架构、MLA 架构等,还给出未来硬件架构设计建议。
“像把大象塞进冰箱一样困难”,端侧大模型是噱头还是未来?
InfoQ《极客有约》X AICon 直播聚焦端侧大模型,探讨其落地挑战与破局思路。专家指出端侧部署有隐私、可用性等优势,但面临内存、精度等难题。华为、支付宝等分享方案,还探讨应用场景、商业模式及未来趋势。
最新W4A4KV4全量化框架,单卡A100大模型推理速度飙升
计算所王颖研究员团队等联合在ASPLOS 2025上发表并开源COMET框架,通过系统 - 算法协同优化,实现全4比特推理性能突破,在多方面有技术亮点,实测性能碾压现有方案且已开源。
SGLang × RoleBasedGroup(RBG):打通大模型推理PD分离架构规模化落地的“最后一公里”
PD分离架构对大模型推理部署意义重大,SGLang支持该架构且性能佳。但从测试到生产落地难,存在部署、资源、可靠性等问题。SGLang开源RBG项目,结合二者为PD分离架构生产化落地提供方案。
所有大模型,都学物理学:北大物理系一篇研究,震撼了AI圈
北大等机构团队跨界用物理学最小作用量原理,提出新颖方法估计 LLM 生成方向性,揭示其背后‘物理定律’。发现 LLM 生成有细致平衡现象,还能用物理指标给大模型画像,让 AI 研究提升到‘物理科学’高度。