大模型智能体」共找到 10668 篇相关文章

算法论文8

×复旦×上交:视触觉融合+闭环纠错,让机器人双臂协作不再「盲操」

联合复旦、上交提出TAMEn,在UMI框架上全方位升级,构建视触感知融合等数据闭环,打通数据采集到再训练链路。其三层闭环让机器人学得更快准高效,在双臂协作任务中提升成功率。

量子位
开源动态8

腾讯混元发布并开源图像模型 2.1,支持原生 2K 生图

9月9日深夜,腾讯发布并开源混元生图模型“混元图像2.1”,支持原生2K高清生图,综合能力领先。它在多方面升级,有诸多亮点,评估显示效果优,还同步开源文本改写模型,能满足多样视觉需求。

InfoQ
开源动态7

国产开源LLM爆发,Qwen、Minimax、美团、腾讯~

近期国产开源LLM爆发,Qwen3-VL家族新增模型,有技术亮点且可免费商用;MiniMax-M2为编码和代理任务打造;美团LongCat-Video、LongCat-Audio-Codec各有专长;腾讯混元世界 - 镜像用于3D几何预测。

PaperAgent
产品应用7

Cursor 3 发布:IDE 不重要了,智能体控制台上位,VS Code 这一套开始失效

Cursor 3 发布,用智能体管理控制台取代传统代码编辑器,标志 AI 辅助开发工具与开发者工作流程重转变。它带来多仓库支持、Cloud Handoff 等功能,转型源于竞争压力,业界对智能体编排层架构设计未达成共识。

InfoQ
算法论文8

首帧的真正秘密被揭开了:视频生成模型竟然把它当成「记忆体」

UMD、USC、MIT研究团队发现视频生成模型会把首帧当作‘概念记忆体’,将视觉实体存于首帧并在后续复用。基于此提出轻量方法FFGo,用少量例子让模型实现SOTA级视频定制。

机器之心
开源动态7

Stripe 发布基准测试:AI 智能体可开发集成方案,但校验环节存在短板

Stripe推出基准测试套件,评估AI智能体构建完整Stripe集成方案的能力,测试聚焦金融系统贴近生产环境的集成场景。测试显示,不同任务类型评测结果差异显著,核心瓶颈在于验证环节,当前智能体短板在校验逻辑等方面。

InfoQ
产品应用7

谷歌Agent正在憋招:AI科学家内测,锦标赛制“炼”想法,一次跑40分钟

谷歌正为Gemini Enterprise开发多智能体系统,能扮演联席科学家提炼想法,实现研究自动化。工作时以锦标赛形式评估想法,一次运行约40分钟,还准备了“想法生成”“联席科学家”等智能体。此外还有“与文档对话”功能。

AI寒武纪
算法论文7

token危机解决?扩散模型数据潜力3倍于自回归,重训480次性能仍攀升

新加坡国立学AI研究者Jinjie Ni团队预训练扩散语言模型(DLMs)与自回归(AR)模型,发现DLMs是超强数据学习者,数据潜力超AR 3倍,重训480次性能仍攀升,还剖析同期研究方法论缺陷。

机器之心
开源动态8

Generalist之后,罗剑岚团队推出LWD,也要变革具身智能训练范式

智元机器人与上海创智学院联合发布全新具身智能训练范式 LWD,可让机器人在真实世界部署中持续自主改进。它打破传统 AI 静态模式,构建数据飞轮,在四维度创新,经测试表现出色,或成具身智能转折点。

机器之心
算法论文8

满分的「差」,Qwen与复旦等揭示编程智能体奖励设计的结构性困境

Qwen团队与复旦等联合发表论文《The Verification Horizon: No Silver Bullet for Coding Agent Rewards》,指出编码智能体奖励设计存在结构性困境,任何奖励信号只是人类意图的‘替身’,验证需成系统与智能体协同演化,并研究多种验证者。

机器之心