「推理能力提升」共找到 6140 篇相关文章
Chain-of-Agents: OPPO推出通用智能体模型新范式,多榜单SOTA,模型代码数据全开源
OPPO个性化AI实验室团队推出智能体推理范式CoA及模型AFM,解决传统多智能体系统通信效率低等问题。AFM在近20项测试中刷新记录,降低推理成本,还介绍了架构、数据构建等,也指出待探索方向。
NVIDIA发布最强开源模型,效果和速度全面超越DeepSeek R1
NVIDIA推出Llama - Nemotron系列开源模型,有LN - Nano、LN - Super、LN - Ultra三款。旗舰款LN - Ultra在权威测评中碾压DeepSeek - R1等,运行效率还更高。有“动态推理开关”功能,代码数据全公开,或引发AI推理效率革命。
MiroMind新模型超越GPT-5.4,三位顶尖AI科学家加盟
MiroMind发布MiroThinker - v1.7模型家族,在深度研究任务中表现出色,其专有智能体MiroThinker - H1超越多个顶级闭源模型。同时,三位顶尖科学家加盟,分别负责推理模型训练等方向,公司聚焦推理与可验证性。
GPT-5编程测评大反转!表面不及格,实际63.1%的任务没交卷,全算上成绩比Claude高一倍
Scale AI的新软件工程基准SWE - BENCH PRO测试中,‘御三家’表面解决率低。深入看,GPT - 5已提交任务准确率比Claude高一倍。该基准新题多、更复杂,能真实考验模型能力,当前模型解决商业问题能力有限。
清华等发布UltraRAG 2.0,仅用50行代码解锁RAG高性能开发
大语言模型存在“知识截止”问题,RAG技术应运而生,成为大模型落地主流方案。但随着需求提升,其工程实现变复杂。清华等推出UltraRAG 2.0,仅50行代码实现同等功能,降低开发门槛,性能提升,还能落地多种场景。
OpenAI发布GPT-5!这是一篇很主观的解读...
OpenAI发布GPT - 5,一口气推出三个版本API。发布会图表出错被吐槽,其自适应思考能力似抄Claude作业。发布会重押编程能力,因Anthropic靠Claude在API市场抢了不少写代码用户,实测中GPT - 5与Claude 4.1表现接近。
不到百万级,看不见 MCP 的真实问题:创始人亲述这疯狂的一年
MCP 联合创作者 David 复盘其发展,从开源协议到行业事实标准,经历多阶段演进。他指出做对死磕标准 HTTP,踩坑让关键能力成可选致双向能力被削,规模达百万级有扩展性问题,还谈及多方面发展与规划。
体验完微信Agent以后,我觉得这就是微信有史以来最大的更新。
作者获微信小微内测资格,深度体验后认为这是微信最大更新。微信Agent打通原生能力有超预期之处,但智能程度不足。功能上有亮点也有限制,如通讯录操作谨慎、小程序适配佳,还能生成小工具。
The Batch: 859 | Qwen3 的自主智能新进展
不到两周前 Kimi K2 超越其他开源非推理模型,如今阿里巴巴发布基于早期 Qwen3 - 235B - A22B 的三款新大语言模型权重,介绍了输入输出规格、架构设计、性能表现、使用方式等,还进行了性能对比。
工行x上交大发布多智能体研究成果,通过群体智能刷新翻译新高度!
2025年多智能体系统成大模型研发新高地。工行大数据和人工智能实验室与上海交大人工智能学院推出多智能体翻译系统TACTIC,以认知翻译学为指导,在相同模型配置下提升翻译效果,在小模型下提升更明显。