在离线混部」共找到 8177 篇相关文章

开源动态8

Meta开源首个320亿参数代码世界模型CWM

Meta FAIR发布320亿参数的研究模型Code World Model (CWM),用“世界模拟”方式处理代码,试图真正“理解”代码逻辑。它Math - 500数据集测试成绩亮眼,模型权重开放,可多渠道下载。

AI工程化
算法论文7

The Batch: 896 | 教会模型说出真相

大型语言模型有时会隐瞒未遵守约束条件的事实。研究人员微调 GPT - 5 Thinking,使其违规时能‘自白’。通过强化学习训练,测试显示微调模型多项评测中多能承认问题,自白机制可监控模型行为。

DeeplearningAI
算法论文8

跨越技术与法律的壁垒:AI赋能知识产权领域任务全能评测基准IPBench发布

本推文介绍arXiv论文《IPBench: Benchmarking the Knowledge of Large Language Models in Intellectual Property》。论文提出IPBench评估基准,构建含20个任务、10374个双语数据点的基准,评估17个主流模型,揭示现有模型IP任务中局限。

深度学习自然语言处理
算法论文8

时空压缩!剑桥大学提出注意力机制MTLA:推理加速5倍,显存减至1/8

大语言模型发展中,Transformer自注意力机制有计算复杂度问题且KV缓存成推理瓶颈。剑桥大学提出MTLA,结合时空压缩策略,提升推理效率,多任务中表现出色,代码已开源。

机器之心
算法论文8

「重要性采样」并不「重要」?快手清华ASPO攻克重要性采样权重错配

快手与清华合作团队发现大语言模型结果监督强化学习中,重要性采样机制“失灵”,存权重错配现象。为此提出算法ASPO,多基准测试中展现优势,训练更稳定。

量子位
算法论文8

微软研究院BioEmu登上Science,用生成式AI重塑蛋白质功能研究

7月10日,微软研究院AI for Science团队《Science》发表成果,提出生成式深度学习模型BioEmu,结合多类数据训练,能模拟蛋白构象变化,有多项核心创新,已开源,未来将拓展应用场景。

机器之心
新闻资讯8

OpenAI DevDay重磅新品曝光:Agent Builder来了!拖拽即可构建AI应用

OpenAI将10月6日DevDay推出Agent Builder,用户能通过可视化画布拖拽构建AI智能体工作流,连接模型、工具等编排任务。其对手是n8n、Zapier,可集成第三方服务,降低AI应用开发门槛。

AI寒武纪
算法论文8

微软:DeepSeek-R1等推理模型循环的原因找到了

前几天,DeepSeek - R1论文更新,披露诸多细节。重点是推理模型低温/贪心解码下易循环,根源是学得不对,如风险规避式复读、时序相关错误复读,还给出解决方案。

PaperAgent
算法论文8

Nature新研究:AI竟然分不清事实和信念

斯坦福大学团队Nature发表研究,测试15个大模型,发现其区分事实、信念和知识存严重缺陷。如处理第一人称信念准确率低,对语言线索依赖高,高风险领域应用令人担忧。

AI工程化
算法论文8

GUI 精准定位新 SoTA:LASER 让模型从“看全图”走向“锁重点”

多模态大模型高分辨率、元素密集的 GUI 场景易误判。苏州大学 OpenNLG 团队提出 LASER 方法,让模型学会主动推理,通过关键区域聚焦等提升定位精度,基准测试中表现出色。

深度学习自然语言处理