「金牌表现」共找到 2275 篇相关文章
Altman 秀新模型“翻车”,谷歌补刀躺赢!OpenAI 前员工爆肝 3 天,编程再赢老东家模型!
近期,OpenAI 携多款未公开新模型亮相。在 IMO 竞赛中,其宣称新模型获金牌,谷歌 DeepMind 的 Gemini Deep Think 也达金牌水平,但网友对二者评价不一。此外,‘o3 Alpha’疑上线,前 OpenAI 员工还在编程赛中击败 OpenAI 模型。
接入 MiniMax M2.7 后,我的 OpenClaw「超进化」了
作者实测 MiniMax 新模型 M2.7,其在基准测试、代码能力、多智能体协作等方面表现出色。接入 OpenClaw 后,能高效完成复杂任务。M2.7 指令遵循率高、长上下文处理能力强且价格低,有望提升 Agent 生态表现。
万人见证,“出轨”CEO被停职;陶哲轩评“OpenAI内部实验模型获IMO金牌”;传字节Seed视觉负责人“暂休”|AI周报
这是一篇AI行业周报,涵盖多领域热点。如Manus季逸超复盘Agent研发经验;陶哲轩评OpenAI模型获IMO金牌;字节跳动绩效改革、人员变动;还有企业动态,像英伟达黄仁勋访华、宇树科技开启上市辅导等。
“大模型第一股”打响上市前哨战!智谱GLM-4.7 刷新开源编程SOTA,修复代码、终端操作表现超Claude 4.5
冲刺大模型第一股的智谱推出开源大模型GLM - 4.7,主打编程与代理式任务提升。它在多项基准测试中表现出色,UI质量飞跃,还采用新推理机制。智谱上市在即,但亏损扩张快,研发投入大。
解道奥赛题成本5000美元?陶哲轩警告,AI下一步要规模化的「更便宜」
谷歌新一代 Gemini 进阶版在 IMO 竞赛达金牌水平,华人数学家陶哲轩对此关注且担忧。他认为评估 AI 表现应谨慎,AI 发展需从定性转向定量,要‘降本增效’,未来标准化评测很重要。
爆冷!字节Seed 在CCPC 决赛只做出一道签到题,而DeepSeek R1 直接挂零?
第十届 CCPC 举行,字节 Seed 携 Seed - Thinking 参赛,仅做出一题,DeepSeek R1 挂零。不同模型架构在比赛中差异不大,暴露出大模型做算法题短板,推理模式模型表现更好。
ICSE 2026杰出论文 | 突破代码模型真实工程落地瓶颈,北大团队提出SEAlign对齐框架:显著提升软件工程智能体决策质量
现有代码模型在经典基准表现好,但在真实软件工程环境表现差。北大金芝、李戈团队提出 SEAlign 框架,通过识别与对齐智能体轨迹关键决策点,提升模型在真实工程任务表现,成果获 ICSE 2026 杰出论文奖。
JustGRPO:扩散语言模型的极简主义回归
本文提出回归极简的方法 JustGRPO,在 RL 阶段让模型自回归生成,用标准 GRPO 训练,能超越各类针对 dLLM 设计的 RL 算法表现,提升推理表现同时保留并行解码能力。
爆冷!字节Seed 在CCPC 决赛只做出一道签到题,而DeepSeek R1 直接挂零?
第十届 CCPC 举行,字节 Seed 携 Seed - Thinking 参赛,结果意外,仅做出一题,DeepSeek R1 挂零。不同模型架构表现差异不大,暴露出大模型做算法题短板,推理模式表现更好。
性能提升11.74%!腾讯优图提出激励推理,专攻复杂指令
现有大语言模型处理复杂指令能力不足,腾讯优图研究团队提出激励推理方法。该方法能提升LLM处理复杂指令表现,在1.5B参数LLM上性能提升11.74%,媲美8B参数模型。