「无监督去偏对齐」共找到 937 篇相关文章
OpenAI开启“印钞机”模式?ChatGPT官宣引入广告,新增8美金/月Go版低价订阅服务
OpenAI宣布广告业务要来了,其低成本订阅服务ChatGPT Go将登陆美国及所有ChatGPT可用地区。未来几周将在美国免费版和Go版中测试广告,Pro、Business和Enterprise订阅方案无广告。还明确广告业务五大原则。
DeepInsight x ChatBI:个人Agent助手养成计划
文章围绕将ChatBI打造成个人Agent助手展开,从用户视角拆解使用流程,分析提问、反问澄清、结果验证等环节的困难与解决办法,还提及MCP协议、通义千问3及阿里云百炼服务对Agent开发的助力。
后生可畏!何恺明团队新成果发布,共一清华姚班大二在读
何恺明团队继5月提出MeanFlow (MF) 后,近日推出改进版Improved MeanFlow (iMF),解决了原始MF三大核心问题。它重构预测函数,还实现灵活的无分类器指导和高效的上下文内条件作用架构,提升了实用性和效率。
NeurIPS 2025 Spotlight | 选择性知识蒸馏精准过滤:推测解码加速器AdaSPEC来了
大型语言模型推理延迟高、开销大,推测解码可加速但依赖草稿与主模型一致性。佐治亚理工等团队提出 AdaSPEC 蒸馏法,过滤难学 token,提升草稿模型与目标模型对齐度,实验显示能提升接受率和推理速度。
深度长文解读 “世界模型” :在虚构与真实交接之处凝视未来
本文深入解读“世界模型”,虽无明确定义,但从目的出发分为表征和生成两类。前者含生物大脑、视觉和语言中心预测;后者有基于规则模拟和数据驱动生成。还探讨LLM是否为世界模型,指出各类模型相辅相成。
让机器人「不仅会想,还能准确去做」,VLA-R1把「推理+行动」带进真实世界
VLA-R1是“先推理、后执行”的VLA基础模型,结合链式思维监督与强化学习,优化推理和执行。它有两阶段训练、三类可验证奖励等创新点,经多层面测试效果好,在多领域有应用前景。
突破LLM数据瓶颈:Meta等提出语言自我博弈,一台模型,两个角色,无限进化
Meta等团队提出“语言自我博弈”(LSP)框架,让语言模型自己和自己“玩游戏”,在无外部数据输入下自我改进。实验显示,其性能可媲美甚至超越用大量人类数据训练的模型,为缓解数据稀缺提供新思路。
CEO 上阵写代码,公司从被传濒临倒闭到千亿估值,最大功臣是Claude?
Airtable是先进无代码应用平台,曾被传濒临倒闭,如今估值达千亿。CEO Howie Liu分享围绕AI重组公司、亲自编程让公司实现正现金流的心路,还探讨推动团队用AI、岗位受影响情况及公司转型策略等。
GPT-5 = Scaling Law失效?毕树超:永远有效,因为它反应的是数据结构,客观规律
Shuchao Bi在哥大演讲阐述AI发展。回顾自监督与强化学习路径,指当前发展遇高质量数据瓶颈,认为Scaling Law不会失效。还探讨通往AGI面临的问题,畅想AI重塑世界,提出两个理解AI发展的心智模型。
1亿美元买不走梦想!但只因奥特曼这句话,他离开了OpenAI
全球AI军备竞赛烧掉3000亿美元,但真正研究「对齐问题」的人不足千人。Anthropic核心成员Benjamin Mann揭秘,2020年底OpenAI安全团队因安全优先级降低集体出走。他拒绝扎克伯格1亿美元邀约,强调AI要把安全放首位。