「元代理框架」共找到 2490 篇相关文章
推理即排序:ReasonRank反常识的2.7倍效率跃迁,新SOTA比快更快
论文提出新型排序模型ReasonRank,将深度推理能力融入排序流程,突破数据瓶颈,采用创新训练框架,效率比主流点对点排序模型快2.7倍,还介绍方法论、技术突破、实验验证等内容,指出局限与未来方向。
微软强塞AI暴涨价!小哥惨遭Office全家桶绑架,每月含泪打钱一次未用
最新调查称仅8%的人愿为AI买单,科技巨头却将AI硬塞进日常软件。外国小哥Ted Gioia吐槽被微软AI全家桶绑架,付费却未用。巨头此举或为掩盖亏损,Meta还计划激进推AI,而ChatGPT将上线新功能。
大模型越反思越错,原来是长链推理通过自我说服加重幻觉 | 北邮
北邮研究团队通过思维链审计实验,揭示大模型长链推理‘越想越错’现象背后的元认知偏差。研究基于RFC协议文档构建受控知识域,分析推理过程,发现反思会加重幻觉,且现有检测方法难以应对。
独家揭秘OpenAI核心文件:AGI五级突破实锤!微软130亿投资或打水漂
新智元揭秘OpenAI核心文件,Ilya Sutskever曾预言AI无所不能,也担忧其失控后果。OpenAI与微软的合同中AGI条款成谈判核爆点,未公开论文划分AGI五级,让微软130亿投资或打水漂。
直播预约 | SwS: 强化学习训练能否不依赖外部知识优化模型的弱点?
该论文提出强化学习场景下的启发式数据合成流程(SwS),利用模型自我感知弱点驱动自动化问题生成,弥补推理缺陷。对其扩展后适应性更广,在多基准测试集和模型上验证有效,性能提升显著。
让机器人学会系统2慢思考,叠衣服倒咖啡等不在话下 | 上海交大&智元机器人
上海交通大学与智元机器人等团队推出Hume——融合系统2慢思考的双系统VLA模型。它结合深度推理与实时控制,在多种机器人平台实验中表现出色,平均成功率达91%,显著超越现有模型。
突破传统检索瓶颈!阿里通义实验室发布 WebDancer,开启多步推理智能体新范式!
在信息爆炸时代,传统检索技术缺乏动态决策能力,难以满足多步推理需求。阿里通义实验室发布的 WebDancer 基于 ReAct 框架,通过四阶段构建,在测试中表现优异,未来规划拓展工具生态、突破任务边界等。
准确率92.7%逼近Claude 3.5、成本降低86%,开源代码定位新神器LocAgent来了
OpenHands 等团队发布 LocAgent,这是用于代码定位的图索引 LLM Agent 框架,准确率达 92.7%。它把代码库解析成图,提供工具接口,经实验效果出色,开源微调模型降本增效,还能提升问题解决率。
首个面向柔性衣物灵巧操作的仿真平台来了,北大、伯克利联合发布
北大和伯克利联合发布首个面向柔性衣物灵巧操作的仿真平台 DexGarmentLab。它基于 Isaac Sim 4.5.0 搭建,有多样化场景、自动化数据采集管线和泛化能力强的策略框架 HALO,可推动柔性物体操作应用。
Rx.NET 7.0 拆分 Windows UI 支持,大幅缩减应用部署体积
Rx.NET 7.0 发布,重点为缩小 Windows 应用部署体积。它将 WPF 等集成功能从核心包拆分,解决自包含应用框架依赖问题。虽有破坏性变更,但维护团队保证了一定兼容性。后续有新开发计划。