「物理推理能力」共找到 4866 篇相关文章
Anthropic 发布最新研究:LLM 展现初步自省迹象
Anthropic 最新研究表明,Claude 展现出真实但有限的内省能力,能在某种程度上识别自己内部状态。研究团队开发验证方法,通过概念注入等实验进行测试,还发现认知控制证据等,不过该能力有局限。
思维锚点:破解LLM Reasoning黑箱的关键句
文章提出思维锚点概念,指推理轨迹中影响后续步骤和答案的关键句。开发三种归因方法,系统论证高级组织句影响力更大,锚点主导错误修正。研究为理解LLM推理机制开辟新途径,开源工具支持可视化分析。
对话上交大程远:AI的终局不在云端,而在“感算一体”的物理世界
文章围绕端侧 AI 展开,以上海交通大学程远研究为例,探讨其技术方向“感算一体”,还提及 Agentic AI 热潮,对比其与大模型热区别,阐述端侧与云端关系,及光计算等底层硬件创新对智能设备的影响。
突破Agent长程推理效率瓶颈!MIT&新加坡国立联合推出强化学习新训练方法
AI Agent处理复杂任务时显存、算力问题凸显,MIT和新加坡国立大学联合提出MEM1框架。它基于强化学习,让智能体学会管理记忆,实现近似常量级显存开销,在多方面表现超越大模型。
大模型外挂“三维物体知识库”来了,大幅增强机器人长程自主操作能力
现有视觉语言大模型(VLM)能让机器人理解指令,但在操作中缺三维空间知识。近日研究提出 RAM 框架,它像“三维物体知识库”,为 VLM 补充空间知识,经 14 项实验验证其操作能力,还探索了在铰接与柔性物体操作中的应用。
Gemini准确率从21%飙到97%!谷歌只用了这一招:复制粘贴
Google Research研究发现,将输入问题复制粘贴一遍,能让大模型在非推理任务上准确率惊人提升,如Gemini 2.0 Flash - Lite从21.33%升至97.33%,且几乎不影响生成速度,但不适用于推理场景。
教你构建私有 AI Coding 平台:Pi、DSH、Codex Harness 扩展能力对比与选型。
文章聚焦构建私有AI Coding平台,对比Pi、DeepSeek Harness、Codex Harness的架构、扩展能力及选型策略。介绍三者交互集成方式,分析其扩展特点,并为不同需求团队给出选择建议。
林俊旸离职后首次发声!复盘千问的弯路,指出AI的新路
林俊旸离职阿里千问后发声,反思千问技术路线,认为千问合并两种模式未做好。他指出推理时代已过,未来是智能体时代,智能体思考将成主流,还阐述了其与推理思考区别及面临的挑战。
推理时间减少70%!前馈3DGS「压缩神器」来了,浙大Monash联合出品
在AR、VR等领域,3DGS是新视角合成(NVS)领域备受关注的技术方案。现有前馈3DGS模型存在编码器容量有限等问题,ZIP Lab和Monash团队引入信息瓶颈原理,推出轻量级模块ZPressor,有效解决信息过载难题。
腾讯网关TGW:用户无感知快速迁移及故障自愈能力 | USENIX ATC '25
腾讯与清华联合论文入选USENIX ATC '25,阐述稳定运行多年的TGW网关架构,展示无损迁移、故障自愈及定位系统。该架构应对业务流量挑战,有高性能、高可用等特性,还分享运营经验。