开源动态8
腾讯混元CL - Bench Life:测AI懂生活能力
机器之心
AI 摘要
腾讯混元团队:推出CL - Bench Life衡量AI生活上下文学习能力。测试发现,顶尖AI模型处理高噪声零碎context能力差,远未读懂日常,后续将推动AI在工作和生活中更智能。
阅读原文 · 机器之心
腾讯混元CL-bench续作发布,让大模型读懂你的日常生活
腾讯混元团队推出CL - Bench Life,用于精准衡量AI在现实生活中的“上下文学习”能力。测试12个语言模型,结果显示模型处理高噪声零碎context能力不足,揭示当前顶尖AI模型还远未读懂日常。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
新闻资讯8
Skild AI:S1模型让机器人学习大升级
北美具身初创Skild AI发布全新机器人基础模型S1,主打上下文学习,能看示范视频完成复杂操作。在未见过任务上成功率达66%,远高于传统方法。其发展或让开发机器人技能像给ChatGPT写Prompt。
量子位
算法论文8
腾讯混元ToolCPT:革新Agent工具预训练
腾讯混元团队在 ACL 2026 Findings 发布的 ToolCPT 指出,Agent 用不好工具病根在预训练。它从真实代码挖工具,写说明书,融入预训练,实验显示能有效提升工具运用能力,但也有局限和成本。
PaperAgent
算法论文8
腾讯混元:SFT训练有15.3%“假学会”样本
大模型微调(SFT)是主流LLM落地方案,但大家默认训练完就是学完了。腾讯混元团队发现SFT存在不完全学习现象(ILP),论文完成了定义ILP、找根因、提诊断框架和验证干预等工作。
量子位
算法论文8
腾讯混元论文展望SFT研究新方向
本文从不完全学习现象出发,展望SFT领域未来研究方向,如未知根因探索、检测方法改进等,还提及推广到其他训练范式、CPT精细化研究等,给出研究优先级和社区建议。
InfoQ