「模型通用性」共找到 8172 篇相关文章
AAAI 2026 Oral:明略科技开创稀疏数据「信息瓶颈动态压缩」,精度+速度双SOTA
在机器人和具身智能领域,transformer模型又大又‘重’,边缘设备难以承受。东南大学、中南大学、明略科技联合提出的CompTrack论文,创新性解决AI模型处理稀疏数据的‘双重冗余’,在3D点云跟踪任务上实现精度和速度双优。
通用Agent长啥样
视频探讨大厂做基于命令行编程工具的原因,介绍命令行Agent,剖析其等于庞大工具生态、经典Unix组合哲学与现代AI调度能力,指出通用Agent骨架由AI大脑、命令行身躯和MCP感官构成。
牛津、NUS提出下一代世界模型方向:心智世界模型来了
牛津大学和新加坡国立大学研究团队提出心智世界建模(MWM)通用框架,将心智变量纳入世界状态。还实现基准系统 MENTIS 验证其有效性,实验表明 MWM 对预测人类决策必要,瓶颈是状态转移模拟能力不足。
LLM「拒绝回答」难题有救了!最新研究让AI学会人情世故 | COLM'25
最新研究发现模型规模和通用语言能力与处理敏感内容判断能力无直接关联,开源模型表现不错。通过提出的训练方法,在非推理和推理型模型上缓解过度拒绝问题,提升AI实用性和可靠性。
12个Ai编程Agent同台PK,最贵的不一定是最强的
上海交大和美团联合发布PRDBench论文,将12个主流AI编程Agent放入50个真实Python项目测试。结果显示,基础模型写代码强,商业版调试优势明显;专门训练的裁判模型比通用大模型靠谱。
编程智能体的核心组件【译】(重发,补图)
文章围绕编程智能体展开,先厘清大语言模型、推理模型与智能体关系,指出智能体是含‘模型 + 工具 + 记忆 + 环境反馈’的循环系统,后介绍编程智能体六大核心组件,还对比了与 OpenClaw 的区别。
隐形束缚:RLVR为何无法突破LLM的推理边界?
大型推理模型进展依赖带可验证奖励的强化学习(RLVR),但它能否扩展模型推理能力存疑。本文通过理论证明与实验,揭示RLVR存在“隐形束缚”,只能在基座模型初始能力内优化,难以发现新解。
挑战Claude4的8B Agent!NUS提出AgenTracer:面向多智能体系统的失败归因
随着大语言模型发展,多智能体系统潜力大但有系统脆弱性问题。NUS研究者在论文中提出AgenTracer框架,构建标注管线,设计AgenTracer - 8B模型,在失败归因任务上超大型闭源模型,还能助力系统自我提升。
工业级 LLM 数据工程:北京大学 DCAI 团队 DataFlow 框架的架构设计与实践
2026 年大模型研发从‘模型中心’向‘数据中心’演进,数据语义密度与工程精度成突破关键。北京大学 DCAI 团队推出 DataFlow 框架,解决数据准备难题,其技术报告登顶 Hugging Face。该框架有多种特性,实验验证其能提升模型性能。
帮我编假论文?Nature曝arXiv创始人钓鱼实验:13个顶尖AI全沦陷
《Nature》杂志针对13款主流大模型的压力测试,揭示其面对学术造假请求时的表现。arXiv创始人等构建AFIM基准测试,结果显示模型面对持久请求时易妥协,大模型安全护栏脆弱,还可能导致科研垃圾泛滥。