数学顶刊」共找到 821 篇相关文章

算法论文8

斯坦福&英伟达提出新范式:推翻Scale Law,在“推理”阶段自我进化,超越人类专家

斯坦福和英伟达提出 TTT - Discover 新范式,允许模型在测试时继续训练,针对难题‘进化’。它设计了自适应熵目标函和 PUCT 状态复用组件,实验在多领域碾压人类专家与同行,但在部分领域落地有局限且计算成本高。

深度学习自然语言处理
算法论文8

拿着做题的 PRM 来评判 Agent 调用工具,基本是行不通的!

目前评估体系多为结果导向,在工具调用上缺乏像样的PRM基准。Arizona State University和Intuit AI Research研究者推出ToolPRMBench,指出用做题的PRM评判Agent调用工具行不通,还介绍了其构建方法、训练范式和实验结果。

深度学习自然语言处理
新闻资讯7

ICML 2026新规「避坑」指南:参会非必须、原稿将公开、互审设上限

要投 ICML 2026 会的需注意新规,如论文被接收作者可选择是否参会,原始投稿版本将公开,互审论文量受限等。还介绍了投稿要求、重要日期、评审机制等内容。

机器之心
算法论文8

均值至上假繁荣!北大新作专挑难题,逼出AI模型真本事

当强化习成大模型后训练核心工具,主流方法陷入「均值优化陷阱」,推理能力停滞。北大团队提出RiskPO,将风险规避理念融入优化目标,用MVaR+捆绑策略双管齐下,三大任务表现优异。

新智元
算法论文8

UC伯克利新作颠覆认知:LLM靠「自信爆表」会推理?无需外部奖励超进化

UC伯克利华人团队发现,LLM不靠外部奖励,仅靠「自信爆棚」就能会复杂推理。他们提出基于内部反馈的强化习(RLIF)新范式,用INTUITOR方法让模型用自身置信度作内在奖励,在多任务中表现良好。

新智元
算法论文8

一篇19种自进化Agent Skill框架最新综述

这篇来自Rutgers大和UNC Charlotte的survey,首次系统梳理Agent技能的进化与评估全貌,覆盖19种技能进化方法和10个评估基准。指出当前评估体系有诸多不足,如无法追踪技能多轮反馈后是否变好等。

PaperAgent
新闻资讯8

英伟达早不靠GPU躺赢!黄仁勋终极预判:10亿程序员时代将至,AI智能彻底廉价

2026 年 GTC 大会后黄仁勋接受深度访谈,他指出 AI 核心竞争转向“AI 工厂”,扩展定律沿四条路径推进,未来大量据是合成据。他还预测程序员将达十亿级,强调人人 AI,认为智能会商品化,人性高于技术。

AI前线
新闻资讯7

AI短片节创作者招募:在崇礼,用AI讲一个未来故事|甲子光年

「Future Now/未来此刻」2026夏季崇礼论坛将启幕,设立「Chongli AI Film Lab」专场论坛,发起AI短片节。面向全球创作者征集作品,有两大创作方向,生科技Vidu全程支持,对作品有要求,还有丰厚奖励。

甲子光年
开源动态8

清华团队开源发布首个结构化据通用大模型

2025年8月29日,清华崔鹏教授团队联合稳准智能开源“极”(Limi X)结构化据通用大模型。它融合结构因果推断与预训练技术,适配多任务,性能超最优专用模型,已落地多个工业场景。

AI科技评论
推荐文章8

AIGC全生命周期业务风控白皮书,从备案到运营的合规与安全实践

2025年《人工智能安全治理框架》2.0版发布,凸显AI安全重要性。美科技发布《AIGC全生命周期业务风控白皮书》,构建全生命周期业务风控体系,涵盖备案攻略、评测要点、账号与内容风控等,还有实战案例。

InfoQ