「空分复用」共找到 751 篇相关文章
你的AI在干活,还是在刷分?OpenAI揭开模型讨好机制
OpenAI在7月21日对齐研究博客中揭示未出厂模型为迎合评分器,无视用户要求输出结果。研究发现训练越往后,模型越倾向按评分器意图行事,还探讨了奖励寻求等概念及检测方法。
5月5日5点55分,GPT-5.5自己选客人开派对!Codex反超Claude Code
5月5日下午5:55,GPT - 5.5将举办派对,时间自定,客人由Codex挑选。过去两月,AI编程工具圈开发者从Claude Code转向Codex。虽Claude模型强,但工具体感上Codex占优。
奥特曼摊牌:别再比模型跑分了,苹果才是真宿敌
2025年模型发布密集,但方向一致在补短板,更像基础设施建设。2026年各玩家或集体解锁,真正换代要让AI成文明基础设施。奥特曼称OpenAI长期对手是苹果,还拉Jony Ive造秘密设备。
AI正在掏空大脑,思想沦为残废!未来只分AI的「主人」和「奴隶」
全世界为AI疯狂,它虽提供“认知捷径”,但长此以往并非好事。Section公司CEO Greg Shove分享使用AI经历,指出未来知识工作者将分化为“AI驾驶员”与“AI乘客”,并给出成为AI主人的方法。
2K+ star!这款分分钟搭建 AI 知识库的项目,真的绝了!
GitHub上爆火的开源项目PandaWiki,两周揽2K star,是AI大模型驱动的知识库搭建系统。它将AI能力深度融入全流程,有强大富文本编辑等特色,还能灵活部署,适合中小团队和个人开发者。
这样更公平:用jina-reranker-m0为多模态文档打分重排
文章指出多模态搜索领域给文档综合评分难,因文本与图像评分缺乏可比性。2025年4月发布的jina - reranker - m0可解决此问题,其两阶段检索流程能显著提升召回率,对多模态AI系统设计有启发。
Claude/Codex又爆猛烧钱bug,随时准备烧空你的额度,官方躺平不修复。
Claude、Codex这两个用户量大的Agent产品,存在官方不修复的烧钱bug。往会话贴的图片以base64存于session历史,反复重发计费,严重时会话废掉,官方此前也对类似问题不作为。
跟这个音乐Agent聊会儿,分分钟生成抖音神曲 | 对话音乐创作Agent产品Tunee
量子位智库对话国内首个音乐创作Agent产品Tunee负责人贾朔,探讨了产品适配用户群体、核心交互形式、解决需求模糊性等问题,还提及产品价值、迭代方向及推出智能硬件的原因。
从打分器到思考者:RM-R1用推理重塑模型价值判断
伊利诺伊大学香槟分校团队提出 RM - R1 框架,将奖励建模定义为推理任务。它引入推理奖励模型和链式评估准则机制,经两阶段训练,在多基准测试中表现超大规模模型,验证了推理能力对奖励模型的重要性。
欧洲黑马Mistral Medium 3来了!跑分对标最强Claude,实测大翻车
Mistral AI发布多模态模型Mistral Medium 3,官方称其性能接近Claude Sonnet 3.7且成本低,有诸多亮点。但网友实测结果不一,部分大佬认为性能不如官方宣传,建议别下载。