模型训练难题」共找到 8611 篇相关文章

新闻资讯7

模型玩不好数独?!Transformer作者初创公司公布排行榜:o3 Mini High“变异数独”正确率仅2.9%

Transformer作者初创公司Sakana AI公布AI解决数独能力排行榜,用全新基准Sudoku - Bench考验大模型创造性推理能力。结果显示大模型总体正确率仅15%,9×9数独中高性能模型o3 Mini High正确率2.9%。

量子位
开源动态8

12.1万高难度数学题让模型性能大涨,覆盖FIMO/Putnam等顶级赛事难度,腾讯上海交大出品

腾讯AI Lab与上海交大团队联合推出首个基于自然语言的数学定理证明框架与数据集DeepTheorem。12.1万道高难度数学“特训题”让模型定理证明性能大涨,7B模型性能比肩或超越现有开源和商业模型

量子位
开源动态8

ROCK & ROLL!阿里给智能体造了个实战演练场 | 开源

阿里开源新项目ROCK,解决了智能体无法在真实环境中规模化训练难题。它与阿里此前的RL训练框架ROLL配合,构成完整的智能体训练闭环,推开了Agentic AI规模化应用的大门。

量子位
算法论文8

让大模型学会“像人一样”查证真伪

伊利诺伊大学香槟分校等校研究团队提出训练框架Veri - R1,为大模型提供“在线查证”新范式。它借助在线强化学习、精细化奖励机制和高质量数据,让模型学会像人一样查证,在多数据集上表现出色。

深度学习自然语言处理
新闻资讯8

Ilya罕见发声:大模型「大力出奇迹」到头了

Ilya大神在近2万字采访中称,AI正从「规模时代」走向「科研时代」,主流「预训练 + Scaling」路线遇瓶颈。他还探讨了AI泛化、安全对齐、预训练范式等热门话题,给出独特见解。

量子位
推荐文章7

Prompt、Skills、MCP:大模型上下文工程核心链路

文章聚焦大模型上下文工程,介绍了Prompt、Skills、MCP核心链路。Prompt是与模型沟通基础,但其有脆弱、难管等痛点,促使向上下文工程演进;Skills是能力单元,可显式化能力、动态组合;MCP解决能力集成问题,虽有争议但理念重要。

AIGC开放社区
新闻资讯7

扎克伯格发文正式告别“默认开源”!网友:只剩中国 DeepSeek、通义和 Mistral 还在撑场面

Meta 首席执行官扎克伯格分享“个人超级智能”愿景,透露公司调整 AI 模型发布策略。此前 Meta 强调开源优势,如今态度转变,巨额投入后或暂停开源新模型,计划并行训练开源与闭源模型

AI前线
算法论文8

AAAI 2026|AP2O-Coder 让大模型拥有「错题本」,像人类一样按题型高效刷题

在AI辅助Coding技术发展背景下,开源大语言模型生成代码有运行错误。上交博士团队提出AP2O方法,构建AP2O - Coder框架,借鉴人类学习模式,经实验验证能提升模型性能、抑制错误、提高样本效率,还适配通用模型

机器之心
新闻资讯7

Meta发布40页报告,具身智能的下一步是「心智世界模型」:能听,能看,能理解,会共情

Meta发布40页报告,首次将对人心智状态的推断概念化为心智世界模型,与物理世界模型实现“双轨建模”。还指出要结合系统A和B让AI自主学习,心智世界模型在多智能体协作潜力大。

量子位
开源动态8

The Batch: 849 | 用于训练网页智能体的生成数据

开发网页智能体常需大量人力标注训练样本,卡内基梅隆大学与亚马逊团队实现训练数据生成自动化。他们构建数据集,通过智能体工作流程生成数据,微调后 Qwen3 - 1.7B 表现出色,还公开数据与方法。

DeeplearningAI