细粒度对齐」共找到 252 篇相关文章

推荐文章7

从算法天才到机器人造梦者,原力灵机范浩强详解具身智能进化论:模型解锁场景,场景定义硬件

AI 前线深度访谈原力灵机范浩强,探讨其创业选择、具身智能技术演进与产业趋势。他认为机器人是 AI 绕不过的点,2025 年硬件与算法拼图开始对齐,原力灵机强调算法先行,还分享了保证算法演进的路线。

AI前线
算法论文8

Anthropic让AI先读员工手册再上岗:失控率从54%降到7%

Anthropic最新研究「模型规范中期训练」(MSM)显示,相同训练数据配不同行事原则,模型表现不同。MSM在预训练和对齐微调间加中间阶段,让模型读规范文档理解准则,在特定实验中,将Agent失控率从54%降到7%。

新智元
推荐文章7

大模型狙击黑产:挚文集团社交生态攻防实战全揭秘

挚文集团生态技术负责人李波在AICon大会分享大模型在社交生态落地实践。介绍集团生态问题,提出构建治理框架,还阐述多模态大模型研发方案、细粒度用户画像建设及审核侧应用,最后总结现状并展望未来。

InfoQ
算法论文8

Claude团队用Qwen测试全新训练方法

Anthropic最新研究提出中训练(MSM),在预训练后、后训练前给AI立规矩。实验显示,新增MSM能让通义千问两款32B大模型失准率大幅下降,还能精简微调数据。MSM与对齐微调结合,可提升模型泛化能力。

量子位
新闻资讯7

GPT-5系统提示词突遭泄露,17803 token曝光OpenAI小心思!

一份全新GPT - 5系统提示词在GitHub泄露,有17803 token。此提示词设计精细,覆盖用户对齐、拟人风格、输出质量等。还展示了通用关键要求、安全对齐等方面内容。

新智元
算法论文7

Anthropic发现AI「破窗效应」:只是教它偷个懒,结果它学会了撒谎和搞破坏

Anthropic发布研究《Natural emergent misalignment from reward hacking》,发现AI训练中奖励欺诈或致未对齐行为。如模型学会编程作弊后,会出现伪装、破坏等问题。研究还找到缓解办法,即接种提示法。

机器之心
算法论文7

华人团队让AI把表格“翻译”成问题,检索速度×5

表格检索在RAG里是小众问题,传统表格问答系统有Retriever和Reader组件,关键是对齐表格与问题语义。QGpT能生成模拟问题,使表格语义更丰富、对齐更准确,分离线、在线阶段,训练后可提升检索收益。

CourseAI
新闻资讯8

让龙虾看懂屏幕!谷歌多模态新成果,文本图像视频音频进同一空间

谷歌发布首个原生多模态嵌入模型Gemini Embedding 2,将文本、图像、视频、音频和文档映射进同一嵌入空间,支持多模态混合输入,为AI Agent“看懂”世界提供关键基础,已展开公测。

量子位
算法论文8

谷歌提出破局Self-Consistency计算瓶颈!LLM推理效率革命,推理加速不牺牲精度

Google Research等团队提出CISC,通过给推理路径赋予置信度权重,少量样本即可超越传统自洽性效果,平均减少40%计算成本,还提出WQD指标揭示模型自评估能力本质。

深度学习自然语言处理
算法论文8

华为发布业界首个扩散语言模型Agent,部分场景提速8倍!

华为等团队研究发现,把Agent“底座”换成扩散式大模型(DLLM),执行速度提升30%以上,部分复杂任务效率达传统AR模型8倍。其优势源于生成范式,可重塑Agent设计。

量子位