智能任务规划」共找到 5070 篇相关文章

算法论文8

九成以上模型止步白银段位,只有3个铂金!通用AI下半场评测标准来了

OpenAI研究员姚顺雨提出AI发展步入新阶段,下半场关键在评估模型真实智能。新加坡国立大学等团队提出“通才智能”评测框架,剖析多模态大模型短板,推出五级评估体系和测试集,测试结果暴露模型弱点,引发社区积极反响。

机器之心
推荐文章7

1M 上下文时代太费 Token,告诉你我的 Coding Agent 省钱方法

当下GPT-5.5等模型原生支持1M上下文,虽能支撑长任务,但易被噪音干扰且费Token。作者以Claude Code为例,介绍做好会话管理的多种省钱方法,如根据任务选择会话策略、利用rewind功能等。

MacTalk
算法论文7

BesiegeField:LLM能否学会设计机器?

香港中文大学推出基于游戏《Besiege》的测试平台BesiegeField,探讨LLM能否学会设计机器。研究通过组合式机器设计视角,测试LLM,提出多智能体迭代设计流程等,发现LLM有挑战但并非不可实现,如Gemini 2.5 Pro表现不错。

带你学AI
推荐文章8

从数据到决策:AI 驱动的 Quick BI 架构设计与实践

阿里云智能集团瓴羊高级技术专家王璟尧,介绍阿里云 Quick BI 从传统 BI 到 AI 驱动的智能 BI 的进化,解析领域大模型与 BI 引擎协同设计等技术权衡,为行业提供可复用技术范式。

InfoQ
新闻资讯8

谷歌最新 Gemini Agent 爆击GPT-5.2?人类最后考试得分见分晓!网友:Altman又该发“红色警报”了

在全球人工智能竞争升温之际,谷歌与 OpenAI 同日更新。谷歌推出全新 Gemini Deep Research 工具,能力提升显著,还开源基准、推交互 API;OpenAI 发布 GPT - 5.2。两者竞争激烈,差距微小,都在争夺智能体框架标准主导权。

AI前线
开源动态8

英伟达全新开源模型:三倍吞吐、单卡可跑,还拿下推理SOTA

英伟达推出专为复杂推理和agnet任务打造的开源模型Llama Nemotron Super v1.5,实现SOTA表现,吞吐量提至前代3倍,可单卡高效运行。它采用NAS优化架构,经多数据集训练,现已开源。

量子位
新闻资讯7

林俊旸离职后首次发声!复盘千问的弯路,指出AI的新路

林俊旸离职阿里千问后发声,反思千问技术路线,认为千问合并两种模式未做好。他指出推理时代已过,未来是智能体时代,智能体思考将成主流,还阐述了其与推理思考区别及面临的挑战。

量子位
算法论文8

蚂蚁 | 提出代码检索/重排基准:CoREB,揭开高分榜背后的三大幻觉,现已接入MTEB

蚂蚁研究人员提出代码检索与重排评测基准CoREB,解决现有基准相关性软、数据污染、任务方向单一问题。它已集成进MTEB,收录19个模型×6个任务评测结果,为代码检索模型评估提供新基线。

AINLPer
开源动态7

小米MiMo Agent 跨会话进化

多数AI编程Agent任务一长就忘事,业界主流靠堆上下文窗口应对,但有缺陷。小米MiMo团队开源的MiMo Code,靠显式存储 - 检索机制,200步以上任务胜率超Claude Code达65%,介绍了其设计及优缺点。

CourseAI
算法论文8

LeCun新作反杀AGI派!AI连「鸟」都搞不懂,拿什么超越人类?

图灵奖得主Yann LeCun联手斯坦福团队最新论文揭示,LLM仅在粗糙分类任务表现优秀,精细任务却失灵。研究测试30多个大模型,得出三大发现,指出LLM与人类在概念形成和信息处理上存在本质差异。

新智元