「推理评测」共找到 2557 篇相关文章
终于,无需邀请码,这款刷新GAIA榜单的Agent你立刻就能用!
今年AI圈新品爱用邀请码等三件套,作者对此不满。天工超级智能体(Skywork)不玩套路,在GAIA评测达SOTA级别。它优化办公三件套场景,使用方便,虽有不足但瑕不掩瑜。
全球第一! 中国模型登顶榜首,首个可编辑AI语音来了
中国AI语音ViiTorVoice登顶全球语音权威评测榜单Seed - TTS,首创「局部编辑」能力,解决语音无法局部编辑痛点。实测效果惊艳,还具备精准情绪控制、无参考文本克隆等能力,部分模型已开源。
10B超越Gemini-2.5-Pro!阶跃星辰端侧多模态天花板开源
阶跃星辰多模态智能团队开源STEP3-VL-10B多模态模型,仅100亿参数却性能惊人。它采用了独特的架构、训练策略与推理机制,在多任务上表现出色,为小模型发展提供新思路。
基于文本AI的终结?Agent协作可直接「复制思维」,Token效率暴涨
在 Agentic AI 时代,多智能体系统让 AI 从单打独斗变为团队协作。普林斯顿大学等机构研究者提出多智能体推理框架 LatentMAS,将协作从 token 空间转移到潜在空间,实验显示其性能、效率大幅提升。
深入剖析AI公司正在面临的:「囚徒困境」
文章指出AI模型训练成本虽下降,但运营成本尤其是推理费用飙升,使AI公司陷入两难。用户只青睐最强模型,且模型资源消耗远超预期,订阅模式难以为继,还给出了避免亏损的三条出路。
Token成本下降,订阅费却飞涨,AI公司怎么了?
文章指出,虽模型训练成本下降,但 AI 公司运营成本尤其是推理费用猛增。以固定费率订阅和高 token 消耗的商业模式的公司面临困境,如 Windsurf、Claude Code 等,还给出避免亏损的三条出路。
IMO 主席正式宣布:Google DeepMind在国际数学奥赛拿下金牌!
Google DeepMind的Gemini Deep Think模型在2025年IMO竞赛获金牌水平成绩。虽比OpenAI公布晚,但实现用自然语言解题质的飞跃。它采用增强推理模式,成绩经官方认证,后续将向用户开放。
Soul App 又放大招!把 42000 小时数据喂出的“歌神” SoulX-Singer 开源了!
语音合成近年爆发式增长,开源领域也有强大音乐模型。Soul APP联合多机构开源的SoulX - Singer,喂了42000小时数据,主打零样本歌声合成,支持双控制方式,多语言与跨语言能力强,架构先进,评测表现优。
Scaling 时代落幕:Ilya 眼中下一代 AI 的关键,不在模型,在人类
深度学习亲历者 Ilya Sutskever 认为单靠扩大模型规模推进 AI 的时代已结束,未来关键在于解决 AI 泛化难题。他指出当前模型评测与现实能力脱节,人类泛化能力强或源于进化,还探讨了价值函数等内容。
首个开源实现100%可复现的稳定RL训练框架来了!2次结果完全重合
SGLang团队联合slime团队开源实现100%可复现的稳定RL训练框架。基于Qwen3 - 8B重复实验结果完美重合。SGLang在批次不变算子基础上实现确定性推理,性能有下降但有提升空间,还给出使用方法和未来规划。