「双维度评估框架」共找到 2361 篇相关文章
OpenAI罕见发论文:我们找到了AI幻觉的罪魁祸首
AI“幻觉”是阻碍完全信任AI的关键障碍,目前无根治良方。OpenAI罕见发论文揭示其根源,指出标准训练和评估程序奖励猜测,应加大对自信错误的惩罚,奖励表达不确定性。
陶哲轩回应OpenAI宣称内部实验模型获得IMO金牌:不予置评「测试方法不公开就是“作弊”?」
OpenAI宣称内部实验模型获IMO2025金牌,陶哲轩呼吁对AI竞赛表现保持审慎。他强调评估AI不能只看结果,测试方法很重要,对未公开测试方法的自我报告成绩不予置评。
给你一群顶尖AI,如何组队才能发挥最大战力?UIUC用一个新的多智能体协作基准寻找答案
现有的评测基准无法衡量多智能体系统内部的协作效率、沟通质量和竞争策略。为此,伊利诺伊大学厄巴纳 - 香槟分校的研究者推出 MultiAgentBench,能全面评估 LLM 多智能体系统协作与竞争能力。
AI学会梦里干活!Claude发布3大进化,Dario:单人公司10亿美金爆发
在 Code with Claude 大会上,Anthropic 为 Claude Managed Agents 上线三项功能。‘做梦’解决记忆退化,成果评估自动检查工作,多 Agent 协作让复杂任务分工处理。Dario 称 AI 时代单人公司或达 10 亿美金营收。
震撼!AI物理「双修」:亥姆霍兹方程嵌进生成器,伪影当场消失
抢滩6G前夜,香港科技大学(广州)等机构发布PhyRMDM框架,将物理约束与生成模型能力融合,解决传统AI构建无线电地图预测失真问题,成果被顶会ACM MM 2025接收,代码和权重已开源。
扎克伯格的豪赌初见成效?Meta新方法让LLM长上下文处理提速30倍
Meta Superintelligence Labs提出REFRAG高效解码框架,解决LLM长上下文输入效率瓶颈。它通过四步流程优化解码,让首个token生成时间加速达30.8倍,扩展上下文,且精度不降反升,不过价值待实际检验。
面向长时语音与声音克隆的全模态开源万能聊天机器人MGM-Omni
文章介绍了全模态开源聊天机器人MGM - Omni,它基于MiniGemini,支持多模态输入输出,具备长语音理解、生成、流式生成、零样本语音克隆等特性,还给出安装、使用方法,展示评估结果。
python打造Google(A2A)+MCP,Langchain生态互补
文章介绍Google的Agent2Agent(A2A)协议,它能实现AI代理通信协作,打破平台孤岛。还提及MCP协议,二者互补。重点介绍python - A2A库,它实现A2A规范,与多框架、模型集成,给出实战示例。
无需人工标注!AI自生成训练数据,靠「演绎-归纳-溯因」解锁推理能力
新加坡国立大学等机构研究者提出元能力对齐训练框架,模仿人类推理心理学原理,将演绎、归纳与溯因能力融入模型训练。实验显示,该方法提升模型在多任务上的性能,且有跨领域可扩展性。
拒绝不必要Think:微软&北大提出第一种自适应大型混合推理模型
大型推理模型冗长思考开销大,微软研究院和北大提出大型混合推理模型(LHRMs),它能依查询上下文决定是否思考。介绍了两阶段训练流程、评估指标,实验显示其超越现有模型且效率高。