多步推理」共找到 5589 篇相关文章

新闻资讯7

Devin CEO:别搞智能体!Anthropic:我们性能提升90%!

最近,开发Devin的Cognition CEO发文称不要构建智能体系统,而Anthropic分享构建智能体研究系统,性能提升90%。Cognition认为智能体协同难,坚持单线程线性Agent;Anthropic用工程设计绕开瓶颈。二者因任务类型不同观点有别。

探索AGI
开源动态8

轻量级开源AI智能体框架!智能路由+上下文管理,前后端接口支持!

随着智能体系统成对话式AI新趋势,GitHub现轻量级高灵活性AI智能体协调框架Agent - Squad,它能实现智能体协作、路由和上下文共享,支持双语言,部署灵活,功能强大且安装友好。

开源星探
算法论文8

大模型训练新突破!“不对称”训练让AI学会自我反思,推理零开销

字节团队提出全新语言模型训练方法PCL,首次打破训练与推理对称约束,实现‘训练-推理不对称’。在训练时让模型反思评估结果,推理时仅输出答案,零额外开销,显著提升模型能力。

量子位
算法论文8

推理正确率下降65.5%!斯坦福、MIT等用「不等式」拷问AI逻辑极限

大语言模型在数学证明常现推理漏洞,斯坦福等高校团队提出IneqMath基准评估其严谨性。用不等式证明题切入,拆解为子任务,构建评测体系,用LLM - as - Judge审查。结果显示模型推理正确率低,存在结构性缺陷。

新智元
算法论文8

LLM 仅靠自身就能增强推理?SePT 给出简洁在线自训练范式

推理后训练方法依赖外部信号,SePT仅用模型自身生成的答案自训练,能提升推理能力,数学推理任务准确率升10个点。它核心简洁,设计关键是温度解耦等,不损模型通用能力,代码易迁移复现。

机器之心
开源动态8

微软发布智能体 Web 操作系统!让 AI 成为真正“可控、协同、透明”的网页执行助手!

微软推出新一代智能体 Web 操作系统 Magentic - UI,它能自动浏览网页、处理数据等,具备智能体协同能力。其界面透明可控,功能丰富,安装使用友好,适用于种复杂场景。

开源星探
开源动态8

Andrej Karpathy 盛赞!斯坦福团队新作,让Llama-1B 实现毫秒级推理

斯坦福Hazy Research团队将开源模型Llama - 3.2 - 1B前向推理整合为“Megakernel”,把推理延迟大幅降低,显存带宽利用率显著提升。团队指出当前主流LLM推理系统在小batch、极低延迟场景下低效,提出Megakernel以重构执行方式。

AI科技评论
开源动态8

妈妈再也不用担心延迟了!斯坦福手搓Llama超级内核,推理仅需0.00068秒

斯坦福Hazy实验室推出低延迟推理引擎「Megakernel」,将Llama - 1B前向传播融入单一GPU内核,H100上提速1.5倍,B200上每次推理仅0.00068秒,比vLLM快3.5倍。文章分析传统引擎问题并介绍Megakernel设计。

新智元
开源动态8

近5w颗星!一个能同时指挥个AI写代码的开源工具来了

现在写代码,很人想开个AI助手。Orca是支持AI Agent的编程开发环境,各Agent在独立git worktree里运行,互不干扰。它功能丰富,还支持系统安装。

GitHubStore
推荐文章7

AICon上海演讲精华回顾:《GMI Cloud 全球化高性能分布式推理服务构建实践》

AICon2025上海站,GMI Cloud资深架构师Frank Lee分享《GMI Cloud全球化高性能分布式推理服务构建实践》,介绍其推理平台,拆解扩缩容等能力,分享架构设计、部署及优化实践,揭秘推理提效关键路径。

InfoQ