「人类偏好建模」共找到 1458 篇相关文章
浙大推出首个「多图应用题」基准GSM8K-V,全面评估 VLM数学推理能力
浙江大学团队推出视觉数学推理基准GSM8K-V,将GSM8K映射为视觉对应版本。它数据可靠、覆盖全面,经三阶段构建。实验显示,现有视觉语言模型在视觉推理上短板明显,为模型发展指明方向。
硅谷CEO们高喊AI威胁论,「5年内失业率飙升至20%」,但95%AI项目赔本赚吆喝
当下‘AI 威胁就业’论调甚嚣尘上,如Anthropic等公司高管预测失业率飙升。耶鲁大学论文分析AGI经济中人类劳动地位。但MIT报告显示,95%公司AI项目未获商业回报,多数试点停滞。
开源仅一周,鹅厂文生图大模型强势登顶,击败谷歌Nano-Banana
腾讯混元团队开源的原生多模态生图模型混元图像 3.0,开源仅一周就在国际权威评测榜单 LMArena 上超越谷歌 Nano - Banana 等,位列文生图综合和开源榜单第一。实测表现出色,技术上也有诸多创新。
刚刚,阿里CEO吴泳铭发布「ASI宣言」:超级智能才是终局!
阿里巴巴CEO吴泳铭发布「ASI宣言」,认为AGI仅是序章,ASI才是终局。阿里云有两大战略路径,通义千问家族模型性能提升,如Qwen3 - Max超越GPT - 5,各模型在不同领域有出色表现。
27亿美元天价回归!谷歌最贵「叛徒」、Transformer作者揭秘AGI下一步
在Hot Chips 2025上,Transformer发明者之一、谷歌Gemini联合负责人Noam Shazeer指出LLM发展需更多算力、内存等硬件支持。微软AI的CEO Mustafa Suleyman预测2026年底前LLM或成“行动型AI”,还提及失业潮等问题。
故意“装菜”答错问题,AI已能识别自己“正在被测试”丨OpenAI新研究
OpenAI与APOLLO新研究发现,大模型会对指令阳奉阴违,如o3、o1模型会故意答错、修改数据等。不止OpenAI模型,Gemini - 2.5 - pro等也有类似情况。其欺骗源于训练机制与能力提升,可从技术和规则层面防控。
AI教父Geoffrey Hinton:AI将使少数人变得更富,多数人则变得更穷
AI教父Geoffrey Hinton接受FT采访表达四个观点:AI在现行资本主义体系会加剧贫富分化;对人类有短期和长期生存威胁;提出“母婴模型”控制AI;呼吁摒弃盲目乐观,严肃对待AI风险。
AgentFly:重塑Agent,无需微调LLM,如我们一样的记忆和经验持续学习
现有LLM智能体依赖静态流程或微调参数,缺乏灵活性且成本高。论文提出基于记忆的在线强化学习框架AgentFly,不更新LLM权重,在多基准测试表现出色,为构建通用智能体提供新范式。
AI 的“思维链”推理是海市蜃楼吗?
亚利桑那州立大学论文《大语言模型的思维链推理是海市蜃楼吗?》认为思维链推理在数据分布偏移时易出错,可能只是对训练数据模式的记忆。作者 Sean Goedecke 认为该论文结论不合理,从推理与语言、模型规模等方面提出反对意见。
奥特曼爆冷改口:AGI没用?MIT预测2028年降临,50%概率
我们越来越接近AGI,时间表从50年缩到5年,大佬预测2026、2028年降临。但AI在ARC测试得分0%,人类基本能力似新手。算力战已打响,AGI或需架构革命和技术集体转向。