人类推理」共找到 3125 篇相关文章

算法论文8

大模型被确诊「视觉文盲」!多校联合提出MILO,为它植入空间想象力

空间推理是多模态大语言模型(MLLMs)应用关键挑战,当前‘语言描述式调优’让模型成‘视觉文盲’。多校联合提出MILO范式,结合视觉生成反馈与语言调优,还构建GeoGen数据集,经五大任务验证其有效。

量子位
推荐文章8

这大概是我见过最通俗易懂的AI发展历程科普详文了

文章从历史时间线出发,介绍AI诞生、发展历程,涉及细分技术模块。结合案例说明AI在不同阶段的应用,如早期机器翻译、垃圾邮件过滤。还探讨AI大模型、智能体等概念,分析调优方法和‘幻觉’问题,展望其未来前景。

腾讯技术工程
算法论文8

“最强具身VLA大模型”,究竟强在哪儿?

机器人基础模型π*0.6刷屏,能让机器人高效完成多项任务。它引入Recap学习法,突破传统模仿模式。其核心方法RECAP让VLA用奖励反馈和人类介入训练,还能从异构数据学习,实现自我进化。

量子位
开源动态8

RLinf上新πRL:在线强化学习微调π0和π0.5

近年来,基于流匹配的VLA模型成机器人领域前沿技术,但训练依赖大量人类演示数据。清华等机构联合推出在线强化学习微调框架πRL,提出两种微调方案,在测试平台验证了有效性,目前代码等已开源。

机器之心
算法论文8

首个实例理解3D重建模型!NTU&阶越提出基于实例解耦的3D重建模型,助理场景理解

人类能自然感知3D世界的几何与语义,但AI做到“两者兼得”是挑战。NTU联合StepFun提出IGGT,将空间重建与实例级上下文理解融为一体,还构建了InsScene - 15K数据集,解决了传统方法的问题。

量子位
开源动态8

超越英伟达Describe Anything!中科院 & 字节联合提出「GAR」,为DeepSeek-OCR添砖加瓦

中科院与字节联合提出「GAR」,为构建自然图像的Dense Caption提供新思路。GAR具备精准描述、关系建模和组合推理能力,通过引入新组件,兼顾细粒度与全局上下文,在多测试集表现优异,且代码等已开源。

量子位
新闻资讯8

提效软件研发,AI Agent好用吗?

InfoQ直播邀请多位专家探讨AI4SE,提及前端知识库特点、Agent自学习等。专家认为AI目前多辅助人类,落地要重视“人”因素,还探讨了应用挑战、衡量维度、未来趋势等,QCon上海站将设专题。

InfoQ
算法论文8

LLM 长文本处理的“不可能三角”?我们用 E2LLM 把它破解了!

长文本理解与推理是LLM的难题,存在效果、速度、兼容性的“不可能三角”。蚂蚁集团和华东师范大学提出E2LLM新范式,实现三者平衡,在效果和效率上表现出色,开启长文本处理新篇章。

PaperAgent
产品应用7

为 OpenAI 秘密提供模型测试, OpenRouter 给 LLMs 做了套“网关系统”

OpenRouter成立于2023年初,为用户提供统一API Key调用各类模型,OpenAI会用其秘密测试。平台token用量高速增长,还发布模型用量排行榜引关注。创始人认为大模型非赢家通吃,未来想成agent最佳推理层。

海外独角兽
新闻资讯7

他,37岁华裔,靠AI成为福布斯400最年轻亿万富翁,身价180亿美金!

37岁华裔Edwin Chen成《福布斯400》最年轻亿万富翁,身价180亿美元。他拒绝VC融资,用积蓄打造估值300亿美元的AI数据标注公司Surge,希望让AI学会「人类的复杂性」,还担忧AI模型被错误优化。

新智元