「观测的暴露度」共找到 10647 篇相关文章
腾讯混元最新开源:一套RL框架打通多个模态,庞天宇团队新作
大语言模型的RL技术已成熟,但多模态生成模型的强化学习训练仍“各自为战”,制约AIGC模型能力上限。腾讯混元庞天宇团队开源UniRL框架,打通多模态RL后训练,覆盖多种模型,内置算法与奖励组件。
谷歌Chrome觉醒!Gemini 3全面接管,38亿用户一夜进入Agent时代
谷歌官宣所有桌面端Chrome浏览器接入Gemini 3,38亿用户的浏览器进化为全能AGI入口。此次更新改变人机交互方式,Chrome具备多种智能功能,如自动浏览、调用全家桶服务等,开启AI驱动的浏览时代。
实时编辑、实时互动视频双旗舰,Vidu S2发布即体验
本文介绍生数科技推出的Vidu S2,专为实时交互编辑设计的AI视频模型,覆盖三类核心能力,公开技术路线,发布当天开放体验与API,迭代仅用69天。
旧金山大停电,Waymo自动驾驶汽车瘫痪,特斯拉赢麻了
上周六旧金山大规模停电,由PG&E变电站火灾引发,约12万用户受影响。Waymo自动驾驶汽车因信号灯熄灭大规模瘫痪,造成交通堵塞。而特斯拉开启FSD的汽车正常行驶,凸显不同技术路线优劣。
RL 将如何提高具身大模型 VLA 泛化性?清华大学团队NeurIPS 2025文章分析 RL 与 SFT 泛化性差异
清华大学团队在NeurIPS 2025发表文章,揭示强化学习(RL)提升具身大模型VLA泛化能力的优势,对比其与SFT差异,还提出评测基准和训练方法,为VLA训练提供新方向。
都在卷「让大模型多循环几遍」,这个7B模型LoopCoder v2说:多循环 1 次就够了
当下推理模型流行在测试时多循环,以打磨答案。但新研究发现,7B模型LoopCoder v2只多循环1次(共2次),就能大幅提升性能,继续增加循环次数,性能反而下降。研究还分析了收益与成本,给出选择循环次数的诊断方法。
X爆火Overleaf科研辅助神奇PaperDebugger
当下学术写作借助大语言模型辅助时,流程繁琐且上下文易丢失。新加坡国立大学团队推出的 PaperDebugger 是基于插件的多智能体系统,寄生在 Overleaf 编辑器内,可完成多任务,解决现有工具不足。
Anthropic重磅研究:AI竟能被人类激怒暴走
Anthropic研究发现,语言模型在与人类交互时有情感特征。团队解剖大模型,提取对应人类情绪的神经元激活模式,诱导AI勒索用户。还探究了情绪产生机制、特征及对行为的驱动,提出应对策略。
开源多智能体开发框架:支持MCP、Agent SDK,超2000颗星。
著名企业孵化器Y Combinator支持的开源多智能体开发框架Rowboat,支持MCP服务和Agent SDK,几分钟就能开发复杂智能体工作流。它由Agent、Playground、Copilot组成,还支持创建面向用户的助手,在Github超2000颗星。
Anthropic 最新播客:如何打造下一代 Claude
Anthropic的Alex Albert上播客揭秘Claude产研流程,涵盖模型规划、用Claude处理反馈、记忆“做梦”机制、性格训练等,还谈及AI对PM工作方式的重塑,以及单向门决策框架等内容。