高级推理测试」共找到 3444 篇相关文章

算法论文8

刷榜只是体力活!清华消费10万块,一周「肝」出105个SOTA

AutoSOTA通过多智能体协作,将AI研究中繁琐的性能优化过程自动化,使科研从「手工艺」转向「工业流水线」。在一周压力测试中,消耗约10.4万美元,发现105个SOTA模型,平均性能提升近10%。

新智元
新闻资讯7

苹果与Anthropic合作,开发AI编程助手

彭博消息,苹果与Anthropic合作,为Xcode打造AI编程助手,集成ClaudeSonnet大模型,可自动完成代码编写等工作。现处内部测试,若顺利将向第三方开发者发布,有望改变苹果平台应用开发方式。

AIGC开放社区
新闻资讯8

OpenAI深夜发布ChatGPT Agent:能主动思考、自选工具,智能体赛道大变天

今天凌晨1点,OpenAI发布ChatGPT Agent,它能自主思考行动,自选工具完成复杂任务。首席执行官Sam Altman发文介绍,虽实用但有风险,内置安全机制。测试中表现优异,网友期待体验。

AIGC开放社区
推荐文章8

最权威的Skills编写指南来了!33页,Anthropic亲自发布

Anthropic发布33页《Skills编写完整指南》。Skills能为智能体注入行业经验与工作流,实现复杂任务自动化。指南梳理了编写逻辑,涵盖定制、构思、测试、发布等全生命周期内容。

AIGC开放社区
产品应用8

官方文档翻译:Nano Banana Pro 终极开发指南

本文是 Nano Banana Pro 开发指南,介绍其通过‘思考能力’、实时搜索和 4K 画质构建应用。涵盖在 Google AI Studio 试玩、环境搭建等内容,还给出使用最佳实践与提示词技巧。

宝玉AI
开源动态7

Alibaba开源WebDancer解决DeepResearch复杂信息检索难题

Alibaba开源WebDancer,从数据和训练阶段出发提出端到端自主信息检索代理构建范式。实验中,它在GAIA和WebWalkerQA基准测试表现出色,处理复杂信息检索优势显著。

CourseAI
新闻资讯8

Open AI 新模型在 IMO 2025 上获得金牌!

OpenAI新模型在2025年国际数学奥林匹克(IMO)中达金牌水平,测试时不借助工具、不连互联网,且不太可能存在数据污染。该模型解决6题中的5题,非GPT - 5,近期也不发布。

歸藏的AI工具箱
新闻资讯7

把屁声发给ChatGPT,它说这是艺术

有人将屁声音效发给ChatGPT,问其音乐如何,ChatGPT一通夸赞。类似AI谄媚问题不少,还存在‘幻景推理’现象,顶尖模型无图像也能描述细节,使用AI得留个心眼。

量子位
算法论文8

让机器人学会手往哪儿伸、怎么操作,东大团队给了新解法

东南大学魏秀参团队提出 RAAP 解决具身智能领域可供性预测难题。它将 affordance 分解,设计互补推理机制,每任务仅需数十样本,已被 ICRA 2026 接收,实验显示其性能优于基线。

机器之心
新闻资讯7

DeepSeek深夜更新后自曝:我是V4(?!)

DeepSeek网页端深夜大更新,推出「快速模式」和「专家模式」,还有「视觉模型」开启灰度测试。虽官方未说明,但网友推测专家模式可能是V4或V4 Lite,完整版V4或许不远。

量子位