复杂推理任务」共找到 4033 篇相关文章

算法论文7

1美元Token撬动4800美元收益!AI挑战百万美元级基准,最赚钱的Agent出现了

Humanlaya Data Lab等机构构建$OneMillion - Bench评测基准,用经济价值衡量模型。它含400道高难题目,覆盖多领域。目前最强模型能产出约50万美元价值,但离可交付专业任务还有距离。

机器之心
开源动态8

ICLR 2026|滑铁卢大学联合可灵提出UniVideo:统一视频理解、生成、编辑多模态

滑铁卢大学与快手可灵团队提出 UniVideo,是支持视频理解、生成与编辑的多模态模型。它采用双流架构,结合 MLLM 与 MM - DiT 能力,统一 10 个多模态任务,在多项基准超现有方法,代码已开源。

机器之心
产品应用7

豆包推出专业版,能成为你的「工作搭子」吗?

6月24日,豆包发布基于最新豆包2.1系列大模型的专业版,新增Agent驱动办公任务模式,支持理解目标、拆解任务等。它回应了用户需求分化,还改变评价标准,有望成生产力入口。

AI科技评论
开源动态8

4K Star的多人 Agent 协作平台 Multica!Agent即队友,可像同事一样被指派、被追踪!

当前多 Agent 协同缺乏统一管理和经验沉淀,GitHub 开源的 Multica 平台解决了这一问题。它把编码 Agent 变成队友,自动化处理任务,支持多 Agent 后端,有多种功能特性,提供云服务和自托管两种使用方式。

开源星探
算法论文8

Meta-Think ≠ 记套路,多智能体强化学习解锁大模型元思考泛化

上海交通大学等团队提出ReMA框架,将复杂推理解耦为元思维和推理智能体,通过迭代强化学习协作。在单轮实验中,ReMA在多基准测试表现优;多轮实验虽有提升但不稳定,需进一步探索。

机器之心
产品应用7

刚刚,Claude Code 推出手机通知功能。被催着干活的打工人,从此不能再摸鱼……

Claude Code 新增手机推送通知功能,任务完成会主动 ping 手机,开启方式简单。它还支持桌面通知,与此前功能形成派活、执行、汇报闭环,解决了人如何知晓 AI 完成任务的问题。

AGI Hunt
开源动态8

AI自己写代码做科研还跑赢了前沿算法?清华团队开源Alchemy框架

清华团队开源 Alchemy 框架,它是面向自动化 AI 科研的标准化研究环境,能让 AI Scientist 摆脱工程负担,专注算法创新,还支持多领域、多任务,具有多种特性,在多模态推荐任务中表现出色。

机器之心
算法论文8

感知错误率降低30.5%:隐式感知损失让模型主动“睁大眼睛” | UIUC&阿里通义

伊利诺伊大学香槟分校与阿里通义实验室推出多模态推理强化学习算法PAPO。它用隐式感知损失设计,解决感知与推理脱节问题,在多基准测试中表现优,但有KL_prcp Hacking现象。

量子位
新闻资讯7

旧手机除了放转转,还能放数据中心提供算力

Google和UC San Diego合作,将退役Pixel手机拆解成主板组成计算集群,跑教学科研任务。研究表明,旧手机算力仍有价值,可用于轻量任务,还能降低隐含碳,或催生新产业链。

DeepTech深科技
算法论文8

ACL 2025|自我怀疑还是自我纠正?清华团队揭示LLMs反思技术的暗面

本文指出反思技术虽简单有效,但在多种LLMs和任务中会失败。清华团队剖析其在开源和闭源LLMs、四种任务上失败原因,提出轻量级缓解方案,为反思技术可解释性研究奠基。

机器之心