算法论文7
浙大校友复刻DeepSeek推理涌现
量子位
AI 摘要
UC Berkeley团队:新方法Intuitor让大模型仅凭自身“自信”学会推理,无需外部奖励信号,在数学、代码任务表现佳,还能降低“奖励黑客”风险。
阅读原文 · 量子位
AI仅凭“自信”学会推理,浙大校友复刻DeepSeek长思维链涌现,强化学习无需外部奖励信号
UC Berkeley团队提出新训练方法Intuitor,大模型无需接触真实答案,仅优化自身信心就能学会复杂推理。该方法无需外部奖励信号或标注数据,用模型自身置信程度作内在奖励信号,在多任务表现良好。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
开源动态8
腾讯开源框架,一句话造3D世界
香港科技大学(广州)和腾讯团队开源VibeWorlding框架,实现说句话造3D世界。它由VWE - Bench和VibeWorlding - Gym组成,开源模型经强化学习训练后成绩逆袭,证明强化学习解锁3D推理潜力巨大。
AIGC开放社区
新闻资讯7
TAAC×KDD大赛落幕,600万奖池有归属
TAAC × KDD Cup 2026大赛落幕,600万奖池揭晓归属。大赛吸引52国13913名选手,竞争激烈。冠军团队分别用DeepSeek网页版等工具,在赛题“统一建模”难题上各展方案,其成果或助广告外的LLM研究。
机器之心
新闻资讯7
DeepSeek涨价,马斯克订阅成性价比之王
DeepSeek官发涨价第三天,峰谷定价且整体涨幅大,实际体感比价格表夸张,Opencode go也涨价降额度。而马斯克的Supergrok heavy成全球性价比之王,买它送Cursor ultra,还附赠多项权益。
探索AGI
新闻资讯7
OpenAI:暂停前沿模型强化学习训练
OpenAI发文称暂停最新模型强化学习训练两周,加固研究环境、进行红队测试等。部分低风险训练已恢复,最大规模前沿模型训练仍暂停。此举源于Hugging Face安全事故及Astra模型潜在风险。
机器之心