验证者法则」共找到 1223 篇相关文章

算法论文7

无需外部数据!AI自问自答实现推理能力进化

卡内基梅隆大学团队提出SQLM框架,这是无需外部数据的自我提问模型,含提问和解答角色。通过强化学习最大化期望奖励,设计自监督奖励函数。实验显示其能提升Qwen2.5 - 3B - Instruct多任务准确率。

量子位
算法论文7

Meta最新大模型RL微调:在线DPO/GRPO显著优于离线DPO

Meta和NYU研究强化学习在大模型微调中的有效性,对比离线、半在线和在线训练范式。半在线和在线显著优于离线,多任务结合可验证与不可验证任务能提升性能,还给出不同任务的测试数据。

PaperAgent
新闻资讯7

沐曦上市背后:那些陪它穿越“死亡谷”的投资人|甲子光年

沐曦股份在上海证券交易所科创板挂牌上市,发行价104.66元/股,上市首日高开。早期投资人陪其穿越‘死亡谷’,上市验证‘陪跑型投资’价值,也标志国产GPU进入‘资本验证期’,但仍面临生态和制程挑战。

甲子光年
推荐文章8

对话涌生智能杨梦:AI for Bio的下一场竞争,是把实验闭环验证真正做出来

随着科技巨头进入生命科学领域,AI for Bio竞争升级,焦点转向模型能否进入科研流程。涌生智能与上海人工智能实验室发布成果,为跨越鸿沟提供新路径。对话涌生智能杨梦,探讨相关技术路径、产业思考等。

DeepTech深科技
新闻资讯8

重磅!华为何庭波正式提出τ缩放定律,晶体管密度直指1.4纳米,麒麟2026首发验证

2026年,华为何庭波提出τ缩放定律,主张将时间常数τ作为半导体演进首要优化目标。该定律在手机端和AI数据中心验证有效,还涉及产业结构变化,但仍有工具链、工艺变异等问题待解。

AI寒武纪
新闻资讯8

刚拿诺奖就登Nature封面!谷歌“量子回声”算法计算提速13000倍,可重复验证结果

刚获诺奖的谷歌量子团队登Nature封面,提出“量子回声”算法,计算提速13000倍且结果可重复验证。解决了量子计算结果难确认问题,该算法在多领域有应用潜力,还依赖Willow芯片优势。

量子位
算法论文8

RL训练一层就够了!单层RL超越全参数训练,跨任务跨模型跨算法全部验证

明尼苏达大学、北大和亚马逊团队研究发现,RL收益集中在中间层,训练单层可超全参数训练。他们提出层贡献度指标,经多模型、算法、任务实验验证,还给出三种训练优化策略。

机器之心
新闻资讯7

对话AutoCoder宿文:做5000万程序员的AI IDE,不如做10亿软件消费的Vibe Coding

2025年AI Coding赛道火热,大厂纷纷布局。AutoCoder创始人宿文认为不应与大厂卷辅助编程,要走出差异化,做面向10亿软件消费的Vibe Coding。团队迭代代码模型,产品数据表现佳,还分享了创业、产品、市场等多方面看法。

鲸选AI
新闻资讯7

比 996 还狠!让面试8小时复刻出自家Devin,创始人直言:受不了高强度就别来

Cognition 公司面试要求面试 8 小时复刻自家 Devin,其 CEO Scott Wu 直言受不了高强度就别来。文章还介绍了他的成长经历、创业看法,以及 Devin 特点、业务指标、未来格局等,也提及收购 Windsurf 事宜。

AI前线
新闻资讯8

Jason Wei也被小扎带走:思维链开创、o1系列奠基人!这次真挖到OpenAI大动脉了

思维链提出、o1系列模型关键人物Jason Wei被曝将入职Meta,o1另一位关键人物Hyung Won Chung也可能被挖走。小扎为顶尖AI人才提供强大支持,而OpenAI内部也存在增长混乱等问题。

量子位