「人类反馈强化学习」共找到 1976 篇相关文章
字节发布全球首个预测未来基准FutureX,Grok-4 拿下冠军
字节跳动发布全球首个实时未来预测基准测试FutureX,杜绝模型作弊。在25个模型评测中,Grok - 4夺冠。它从多网站构建问题,分四级难度。人类专家在部分等级仍领先AI 。
mem0推出王炸mcp工具OpenMemory,打造用户私有、跨应用的共享记忆层
mem0项目推出OpenMemory MCP,这是专为兼容MCP的AI客户端设计的私有记忆层,能解决跨AI工具的Context共享问题。它强调隐私和本地控制,功能实用,获用户积极反馈。
写代码从来不是瓶颈
Pedro Tavares认为软件开发瓶颈并非写代码,而是代码审查、知识传递等“人类开销”。LLM让写代码变容易,但理解、测试代码成本更高,未解决根本问题,团队理解代码成本才是瓶颈。
复杂空间推理新SOTA,性能提升55%!中山大学新作SpatialDreamer
中山大学等机构推出SpatialDreamer,模拟人类空间认知过程,构建闭环推理流程,还提出GeoPO解决奖励稀疏问题,构建SpatialDreamer - SFT数据集。实验显示其在多基准达SOTA,为AI空间智能发展开辟新路径。
OpenAI 推出 gpt-realtime:语音智能体进入“秒回”时代,开发者直呼交互更自然
OpenAI 发布语音对语音模型 gpt - realtime,开放 Realtime API。其结合可端到端处理语音,缩短响应时间。模型语音质量、理解能力、函数调用能力提升,API 全面升级,多家企业已试点,还强化了安全措施。
OpenAI 万字报告: 不要再卷Agent了~
OpenAI《How People Use ChatGPT》报告显示,73%的ChatGPT用途与工作无关,用户多将其用于实用建议、信息查询和写作。Asking对话占比及满意度更高,机会藏在人类惰性里。
GPT-5.5 Instant发布:人人免费,幻觉暴降52.5%
OpenAI发布GPT-5.5 Instant,全面替代老版本成默认选择。新模型降低高风险领域幻觉比例,回答更精简,能调用过往聊天和邮箱信息提供专属反馈,且人人免费。
「重要性采样」并不「重要」?快手清华ASPO攻克重要性采样权重错配
快手与清华合作团队发现大语言模型结果监督强化学习中,重要性采样机制“失灵”,存在权重错配现象。为此提出算法ASPO,在多基准测试中展现优势,训练更稳定。
复旦等推出「第一人称视听基准」,补齐多模态模型「听觉拼图」
多模态大模型在真实世界会“失聪”,现有第一人称视频问答/理解基准长期偏“视觉中心”。复旦等团队推出首个系统评测第一人称声音理解能力的基准EgoSound,能让模型听懂世界,评测显示当前模型与人类差距大。
阿里QwenLong-32B:1W+超长Token推理,知识密集型复杂文档高效推理
文章介绍阿里QwenLong - 32B在长文本推理的能力。长文本推理有训练效率低和优化不稳定问题,QWENLONG - L1通过强化学习等解决,还阐述其组件、训练步骤,并给出实战代码及相关链接。