行为校准强化学习」共找到 927 篇相关文章

算法论文8

Anthropic让AI先读员工手册再上岗:失控率从54%降到7%

Anthropic最新研究「模型规范中期训练」(MSM)显示,相同训练数据配不同行事原则,模型表现不同。MSM在预训练和对齐微调间加中间阶段,让模型读规范文档理解准则,在特定实验中,将Agent失控率从54%降到7%。

新智元
新闻资讯7

GPT-5系列咋都爱说「哥布林」?原因找到了

OpenAI发布博客解释模型迷上「哥布林」的原因。原来是训练“Nerdy”人格时,奖励信号偏爱怪物词汇,强化学习将风格固化并扩散到普通对话。此前DeepSeek V3.1也出现过「极」字Bug。

机器之心
7

Anthropic开始抢科学家了?周薪2.7万驻场,专治Claude专家级错误

Anthropic新推出STEM Fellow岗位,招募STEM领域专家驻场三个月,周薪3800美元,用其判断力校准Claude输出质量。其三年来科研路线不断加码,正构建科研生态。AI科研瓶颈是判断力而非算力。

新智元
产品应用8

懂方言,通诗词,精通30国语言,阿里发布语音识别大模型Fun-ASR1.5

阿里发布语音识别大模型Fun - ASR1.5,可精准识别30种语言,覆盖中文七大方言体系及二十余种地方口音,强化古诗词诵读专项识别,后处理环节优化标点预测和文本归一化,降低人工成本。

千问大模型
产品应用8

比「小龙虾」更能打,中国AI视频大模型悄悄登顶全球第一

昆仑万维旗下 SkyReels-V4 Preview 版在权威评测平台超越 OpenAI、Google 等模型,登顶全球第一。它提升语义理解和逻辑能力,新增参考任务,还支持多语言短剧生成、视频编辑等,将在中关村论坛亮相。

机器之心
算法论文8

大模型学会拖进度条看视频了!阿里新研究让视频推理告别脑补,实现证据链思考 | ICLR 2026

阿里巴巴未来生活实验室团队解决多模态大模型视频推理难题,推出ReWatch数据集和ReWatch - R1模型。数据集克服现有训练数据痛点,模型用SFT + RL范式及创新奖励机制,实验成绩SOTA。

量子位
算法论文7

DeepSeek-R1推理智能从哪儿来?谷歌新研究:模型内心多个角色吵翻了

过去两年大模型推理能力跃迁,谷歌等机构研究指出,推理能力提升源于模型推理时隐式模拟类多智能体交互结构“思维社会”,还提出利用“群体智慧”新方向,并介绍了研究方法、实验结果等。

AINLPer
算法论文7

The Batch: 899 | 更划算的推理

研究人员提出 Delethink 强化学习方法,训练大模型定期截断推理 token 至固定最大数量,以限制处理长思维链成本。经测试该模型在多方面超基线,且缓解计算成本限制,为长上下文推理提供路径。

DeeplearningAI
产品应用7

实测完豆包Seedream 4.5,替我设计师朋友哭了

火山引擎推出图像创作模型Doubao - Seedream - 4.5,有强化原图保持、多图组合生成、优化海报排版与Logo设计等主打点。经实测效果不错,已全量开放API并公测,官方还给出生图tips。

量子位
新闻资讯8

Anthropic 哲学家首次 AMA:关于 AI 哲学与伦理边界

Anthropic的哲学家Amanda Askell在首次AMA中,就AI哲学与伦理边界等诸多问题作答,涉及AI道德决策、模型特点、理论与实践、模型福祉等内容,还谈及对各类问题的看法及解决思路。

AGI Hunt