长任务处理」共找到 3052 篇相关文章

算法论文8

超越Claude Mythos和GPT-5.5!斯坦福Agent验证框架拿下SOTA,Transformer作者转发

斯坦福、伯克利与英伟达联手打造LLM-as-a-Verifier验证框架,该方法是通用验证机制,可与任意Agent Harness和模型结合。研究表明扩展验证阶段计算量,能提升Agent整体性能,在多基准测试中超越Claude Mythos和GPT - 5.5。

量子位
产品应用7

刚刚,Claude Code 推出 Routines,让 AI 自动帮你值夜班

Claude Code 上线 Routines 新功能,支持定时、API、GitHub 事件三种触发方式,可叠加使用。它跑在云端,接入外部连接器,面向所有付费用户开放,目前处于 Research Preview 阶段。

AGI Hunt
新闻资讯8

姚顺宇谷歌首秀,Gemini新模型刷爆SOTA:人类仅剩7人捍卫碳基编程

面对Claude Opus 4.6和GPT Codex 5.3的攻势,谷歌升级Gemini 3 Deep Think,在多项基准测试刷爆SOTA,推理成本降低82%。它还走进科研工程领域,其研发团队有不少华人,如姚顺宇、Yi Tay。

量子位
开源动态8

18K+标星!视觉AI驱动的浏览器自动化,告别XPath,无惧网页改版!

网页自动化常遇页面更新脚本报废等难题,而开源工具Skyvern不走传统XPath/DOM路子,用视觉+大语言模型理解网页,能自适应改版,功能丰富,安装运行简单。

开源星探
推荐文章7

Anthropic的多智能体,真的有必要吗?

作者曾质疑多智能体系统,看了Anthropic对「Claude Research」的说明后有了改观。介绍了多智能体系统定义、性能提升、代价,还阐述构建方法、评估方式,公开三个核心提示词及协作模式。

AGI Hunt
新闻资讯7

Cloudflare 构建了面向 LLM 的高性能基础设施

Cloudflare发布全新基础设施,可在全球边缘网络运行大型AI大语言模型。它将模型输入处理与输出生成拆分,自研Infire推理引擎,还推出Unweight模型压缩系统,分享提示词缓存优化方案。

InfoQ
算法论文8

让机器人学会手往哪儿伸、怎么操作,东大团队给了新解法

东南大学魏秀参团队提出 RAAP 解决具身智能领域可供性预测难题。它将 affordance 分解,设计互补推理机制,每任务仅需数十样本,已被 ICRA 2026 接收,实验显示其性能优于基线。

机器之心
开源动态8

「豆包手机」被智谱开源了,AutoGLM 实测

豆包手机发布后火爆,智谱开源AutoGLM,能让安卓手机变「AI手机」。作者实测,它能完成点外卖、比价等任务,设计贴心尊重隐私。适合开发者、效率爱好者等,还会推动Phone Agent生态发展。

特工宇宙
开源动态8

1.7K Star 新晋神器!一款轻量、开箱即用的终端日志神器,AI 助力、实时可视化,效率飞升!

现在系统日志信息量大、噪声多,传统工具定位问题既慢又麻烦。而开源工具Gonzo基于Go语言开发,有实时日志流处理、交互式仪表盘等功能,安装简单,打破传统工具局限,节省时间。

开源先锋
新闻资讯7

Meta重组AI团队后首个模型来了:不是最强、不再开源、可能够用

当地时间4月8日Meta发布Muse Spark,是重组AI团队后首个模型。它计算效率有提升,在多模态和健康任务领先,但在编程等场景落后。该模型闭源,适配Meta产品,未来优先产品再生态。

DeepTech深科技