「推理质量评估」共找到 3139 篇相关文章
开源打破“AI黑箱”!集结全球大咖,GOSIM Paris 2026带你看懂Agent时代大变局
GOSIM Paris 2026在巴黎举办,是面向开发者的开源AI技术大会。大会由GOSIM主办,CSDN等联合打造,聚焦AI能力落地应用。首日Keynote多位大咖探讨AI相关问题,还有三大论坛、工作坊、Hackathon等活动。
Insanely Fast Whisper:开源社区让音频转录速度提升19倍
Insanely Fast Whisper工具将OpenAI Whisper转录速度提升19倍,采用Flash Attention 2技术,零质量损失。它集成多语言支持、说话人分离等实用功能,还支持跨平台,免费运行。最初是基准测试demo,值得音频处理用户关注。
The Batch: 944 | Llama 之后的时代
Meta发布首个AI模型Muse Spark,是多模态推理模型,在部分健康和多模态测试领先,编程与智能体任务有不足。Meta披露技术细节少,该模型基准测试有竞争力,但其从开放转向封闭引开发者担忧。
不止动起来:SentiAvatar重新定义3D数字人动作生成范式
AI 初创公司 SentiPulse 联合团队提出 3D 数字人动作生成新范式 SentiAvatar,打造虚拟角色 SUSU,其框架等已全球同步开源。它解决了高质量数据荒等问题,实验表现优,还实现快速动作生成,支持流式交互。
论文精选 | 以AI赋能力学:计算力学的智能化之路与未来图景
中国力学学会旗舰期刊AMS推出“力学前沿”专栏,首期解读“计算力学的智能化之路与未来图景”。文章介绍智能计算力学三大范式、面临挑战,还阐述重塑智能框架前沿方向,指出AI与计算力学融合是系统性重构。
1美元时薪?这才是打工人的「梦中情模」
Anthropic 的 Opus 4.6 好用但贵,MiniMax 推出 M2.5 与之抗衡。M2.5 在多方面表现卓越,参数量小,成本低,推理速度快,还经实测能成打工人得力助手,其背后有独特训练体系。
挺意外的,Agent长期记忆潜力被AMemGym挖出来了
论文提出交互式在线策略评测框架AMemGym,它能反映AI助手长期记忆能力、驱动Agent自我进化记忆。它以结构化状态演化为骨架支撑自由对话评测,还对主流记忆系统做了扫描,带来评估与训练范式转换。
开源8300小时标注数据,新一代实时通用游戏AI Pixel2Play发布
随着AI在代码和图片生成领域成熟,研究人员开始关注其在游戏领域的表现。此前的专用模型缺乏跨游戏泛化能力,通用模型在游戏环境中表现不佳。为此,Player2研究员提出Pixel2Play模型,还开源了代码和数据集。
2025小结:从RL到Agentic RL
作者回顾2025年从RL到Agentic RL的发展,指出Agentic RL存在慢、不稳定、难scale的问题,还探讨了RL与推理、CoT的关系,以及RL的泛化能力,认为RL能提升模型能力但还不稳定,期待明年研究。
数据合成篇|多轮ToolUse数据合成打造更可靠的AI导购助手
文章以租赁导购助理“小不懂”为例,介绍Tool Use训练数据合成方案。先分析训练数据的目标与难点,提出动态多智能体对话生成框架,阐述多轮数据、复杂问题合成及过滤方案,展示数据和模型效果,还提及未来工作方向。