双模型博弈」共找到 218 篇相关文章

新闻资讯7

首个为手机而生的通用Agent?!苹果做不到的事,“野路子”智谱抢先实现了

苹果预计2026年升级Siri实现自主行动,但完整落地的执行Agent仍未推出。8月20日,智谱发布AutoGLM 2.0,宣称是全球首个可在手机用的Agent,开创‘Agent + 云手机 / 云电脑’范式,能代理操作高频应用。

AI前线
开源动态8

刚刚,梁文锋署名开源「记忆」模块,DeepSeek V4更细节了

十几个小时前,DeepSeek 发布新论文,与北大合作,作者有梁文锋。针对大模问题提出条件记忆,用 Engram 模块实现,已开源。结合此前研究,DeepSeek v4 模样渐清。模性能、效率表现优,并发现 U 扩展规律。

机器之心
开源动态8

阿里通义开源「推理+搜索」预训练新框架:小模媲美大模,多个开放域问答数据集表现显著提升

阿里通义实验室开源通用预训练框架MaskSearch,引入检索增强掩码预测任务,兼容两种训练方法。实验显示,它在多数据集提升模性能,小模能媲美大模,还验证了训练方式、策略及奖励函数的效果。

量子位
算法论文7

AI邪修时刻!Meta联手MIT投毒,左脚踩右脚强行升天

Meta的SOAR架构用错误率高的数据让模推理能力暴涨9.3%。它选难题子集,用‘教师模’生成含错题的‘垫脚石问题’,通过‘双层博弈’和‘有根奖励’机制让模进步,或成AI进化新方向。

新智元
开源动态8

Qwen3家族训练秘籍公开:思考/非思考融进一个模,大模蒸馏带动小模

Qwen3技术报告揭晓8款模关键技术,采用双模式架构,训练和微调分段进行,还“大带小”蒸馏数据。其融合思考与非思考模式,训练分多阶段,Qwen Chat还全量上线深度研究功能。

量子位
推荐文章7

幸好图灵不是一位好棋手

本文讲述图灵因棋艺平庸常和唐纳德·米奇对弈,二人合作博弈树算法成AlphaGo核心。米奇受其影响成AI研究先驱,开发算法、程序,其对国际象棋残局的研究影响众多后来者。

量子位
新闻资讯7

27亿美元天价回归!谷歌最贵「叛徒」、Transformer作者揭秘AGI下一步

在Hot Chips 2025上,Transformer发明者之一、谷歌Gemini联合负责人Noam Shazeer指出LLM发展需更多算力、内存等硬件支持。微软AI的CEO Mustafa Suleyman预测2026年底前LLM或成“行动AI”,还提及失业潮等问题。

新智元
开源动态8

荣登HuggingFace周榜首位, 人大高瓴与快手提出ARPO实现智能体高效训练!

人大高瓴与快手提出的ARPO项目受高度关注,荣登Huggingface Paper日榜、周榜双首位。它是为多轮交互LLM智能体设计的强化学习算法,在基准测试中,用一半工具调用预算就显著优于现有方法。

PaperAgent
新闻资讯7

阿里云飞天企业版X平头哥“真武”芯片,推理性能跃迁13倍,底层逻辑是什么?| Q推荐

过去几年,模虽强但使用成本高,阻碍企业级AI深度应用。今年‘模推理’成AI关键词,4月13日19:00,InfoQ联合阿里云邀专家围绕推理加速底层破局展开对话,探讨算力博弈、芯片性能跃迁等问题。

InfoQ
算法论文8

震惊!如果AI掌控核按钮,95%的情况它会按下去

伦敦国王学院研究者让GPT - 5.2、Claude Sonnet 4和Gemini 3 Flash三款模模拟核危机博弈。不同时间框架下模表现不同,还展现复杂战略推理能力,95%对局用了战术核武,暴露诸多问题。

AIGC开放社区