「人类反馈强化学习」共找到 1976 篇相关文章
北大校友、OpenAI前安全副总裁Lilian Weng关于模型的新思考:Why We Think
北大校友Lilian Weng更新博客《Why We Think》,回顾利用测试时计算研究进展,探讨激励模型思考方式,介绍思维链、并行采样、序列修订等策略,还提及强化学习、外部工具使用及未来研究方向。
外行瞎写的Vibe Coding,都能并入Agent 工程了:最吓人的是,我们“摆烂”有正当理由了
本文编译了软件专家 Simon Willison 在播客的访谈内容。他指出 Vibe Coding 与 Agent 工程正走向融合,AI 写代码渐趋可靠,人类审查成开发瓶颈,还探讨了 AI 对编程的影响、算力成本博弈等问题。
16岁炒马斯克鱿鱼,SpaceX天才转投北大数学校友赵鹏麾下
16岁天才Kairan Quazi从SpaceX离职,入职全球顶尖量化交易公司Citadel Securities。他曾14岁毕业于圣克拉拉大学,被马斯克选中加入SpaceX。他表示量化金融反馈快、结果直观,且新公司欣赏他的非传统背景。
「斯坦福AI小镇」创业即获投1亿美元!李飞飞卡帕西都投了
2023年斯坦福团队构建AI小镇Smallville,其智能体可自主生活。如今团队创业成立Simile,获1亿美元融资,李飞飞、卡帕西跟投。它将升级架构构建大规模模拟平台,用于人类决策的风险预测。
豆包,即将杀死比赛
本文讲述作者在不同场景的经历,展现豆包在大众心中的高认知度。还提及豆包用户规模领先、被业内人士使用、成内容创作热点等,且将深度嵌入春晚,或强化“AI = 豆包”印象。
用人类脑电波教 AI 开车,这位清华 90 后学者直言隐式信号里藏着 AGI 的关键 | 万有引力
清华大学龚江涛团队用人类驾驶员脑电波教会自动驾驶模型“思考”,成果E³AD发表于NeurIPS 2025。龚江涛从计算机转向人机交互,在多段科研经历中积累经验,探索将人类“直觉”赋予AI。
陶哲轩盖章!GPT-5.2杀疯了,我们终将沦为「硅基帕鲁」
币圈玩家Neel Somani用GPT - 5.2 Pro攻克数学难题,陶哲轩盖章确认。但此成功背后是极低的通过率,靠Aristotle工具筛选。人类数学家或转向定义问题,数学美感可能丧失。
Dario Amodei 达沃斯访谈全记录:AI 的力量与风险
2026 年 1 月 20 日达沃斯论坛,Anthropic CEO Dario Amodei 接受专访,谈及 AI 发展程度、公司定位、中美竞争等多话题。他认为 AI 呈指数增长,一两年内或超人类,同时警告岗位消失、财富差距等风险。
让VLM学会「心中有世界」:VAGEN用多轮RL把视觉智能变成「世界模型」推理机器
当前VLM智能体面对复杂视觉任务表现不佳,美国西北大学等机构联合研究成果VAGEN,提出创新强化学习框架,奖励正确思考过程,让VLM在行动前构建内部世界模型,效果超多款闭源大模型。
奥特曼公然叫板马斯克!重金杀入脑机接口,硅谷两大巨头彻底决裂
据金融时报,奥特曼准备豪掷重金扶持Merge Labs与马斯克的Neuralink竞争。两人此前在AI领域就冲突不断,如今战火蔓延到脑机接口领域,这场科技战争关乎人类未来。