「评估框架」共找到 2212 篇相关文章
让 AI 像真人一样操控手机完成各种复杂任务
MobiAgent是强大的移动端智能体系统,含智能体模型家族、加速框架、评测基准。能让AI像真人操控手机完成复杂任务,提供开箱即用App,内置经验检索模块可自动优化规划。
李飞飞万字长文爆了!定义AI下一个十年
李飞飞最新长文指出,AI下一个前沿是「空间智能」,它能让「看见」升华为「推理」等。她揭秘了空间智能「世界模型」核心框架和三大核心支柱,还阐述了其应用领域及构建挑战。
NeurIPS 2025 | 北大联合小红书提出Uni-Instruct:ImageNet单步生图FID进入1.0时代!
北大联合小红书提出的 Uni - Instruct 框架被 NeurIPS 2025 接收,它统一超 10 种单步扩散模型蒸馏方法,在多项任务达最佳性能,还能用于文本到 3D 生成。
OpenAI罕见发论文:我们找到了AI幻觉的罪魁祸首
AI“幻觉”是阻碍完全信任AI的关键障碍,目前无根治良方。OpenAI罕见发论文揭示其根源,指出标准训练和评估程序奖励猜测,应加大对自信错误的惩罚,奖励表达不确定性。
陶哲轩回应OpenAI宣称内部实验模型获得IMO金牌:不予置评「测试方法不公开就是“作弊”?」
OpenAI宣称内部实验模型获IMO2025金牌,陶哲轩呼吁对AI竞赛表现保持审慎。他强调评估AI不能只看结果,测试方法很重要,对未公开测试方法的自我报告成绩不予置评。
给你一群顶尖AI,如何组队才能发挥最大战力?UIUC用一个新的多智能体协作基准寻找答案
现有的评测基准无法衡量多智能体系统内部的协作效率、沟通质量和竞争策略。为此,伊利诺伊大学厄巴纳 - 香槟分校的研究者推出 MultiAgentBench,能全面评估 LLM 多智能体系统协作与竞争能力。
AI学会梦里干活!Claude发布3大进化,Dario:单人公司10亿美金爆发
在 Code with Claude 大会上,Anthropic 为 Claude Managed Agents 上线三项功能。‘做梦’解决记忆退化,成果评估自动检查工作,多 Agent 协作让复杂任务分工处理。Dario 称 AI 时代单人公司或达 10 亿美金营收。
震撼!AI物理「双修」:亥姆霍兹方程嵌进生成器,伪影当场消失
抢滩6G前夜,香港科技大学(广州)等机构发布PhyRMDM框架,将物理约束与生成模型能力融合,解决传统AI构建无线电地图预测失真问题,成果被顶会ACM MM 2025接收,代码和权重已开源。
扎克伯格的豪赌初见成效?Meta新方法让LLM长上下文处理提速30倍
Meta Superintelligence Labs提出REFRAG高效解码框架,解决LLM长上下文输入效率瓶颈。它通过四步流程优化解码,让首个token生成时间加速达30.8倍,扩展上下文,且精度不降反升,不过价值待实际检验。
面向长时语音与声音克隆的全模态开源万能聊天机器人MGM-Omni
文章介绍了全模态开源聊天机器人MGM - Omni,它基于MiniGemini,支持多模态输入输出,具备长语音理解、生成、流式生成、零样本语音克隆等特性,还给出安装、使用方法,展示评估结果。