复杂指令」共找到 1159 篇相关文章

算法论文8

GPT-4o-Image仅完成28.9%任务!上海AI实验室等发布图像编辑新基准,360道人类专家严选难题

上海人工智能实验室等团队针对图像编辑AI提出问题,推出RISE任务及配套评测基准RISEBench。测试九个视觉编辑模型,结果显示当前模型完成复杂指令能力欠缺,闭源与开源差距大。

量子位
开源动态8

攻克大模型「表格盲区」!ST-Raptor框架发布,实现复杂半结构化表格的精准理解与信息抽取

半结构化表格布局多样、结构复杂,让自动化数据处理困难。上海交大等团队发布 ST - Raptor 框架,提出 HO - Tree 数据结构及树上操作,构建 SSTQA 数据集,提升表格问答准确率,弥补大模型处理短板。

机器之心
产品应用8

离谱!现在的Agent都卷成100个成团了?3分钟并行干完5个复杂任务,还能随时改需求

百度文库、百度网盘联合发布全球首个全端通用Agent——GenFlow2.0,能让100+AI专家Agent天团并行工作,3分钟交付5、6个复杂任务,还能随时改需求。它依托权威资料,可控性强,多任务并行,已上线百度文库Web端/APP。

量子位
开源动态8

让AI当「动作导演」:腾讯混元动作大模型开源,听懂模糊指令,生成高质量3D角色动画

3D角色动画创作面临成本高、数据稀缺等问题。腾讯混元团队研发的混元Motion 1.0动作生成基础模型于2025年12月30日开源,通过全链路算法创新,为3D角色动画生成确立新技术范式。

量子位
算法论文8

RSS 2025|从说明书学习复杂机器人操作任务:NUS邵林团队提出全新机器人装配技能学习框架Manual2Skill

新加坡国立大学邵林团队提出 Manual2Skill 框架,利用 VLMs 将说明书视觉指令转化为机器人装配技能,含层级化装配图生成、分步骤位姿估计、动作生成与执行三阶段,实验验证其在多场景的有效性。

机器之心
算法论文8

绝美无痕,比你还会P图的Agent!仅通过自然语言指令,灵活使用数百工具,超越GPT-4o达60%

JarvisArt提出多模态大模型驱动的智能Agent,通过理解自然语言指令,协调200+个Lightroom工具,实现媲美专业修图师的非破坏性编辑。其内容保真度超越GPT - 4o达60%,为AI艺术创作开辟新路径。

深度学习自然语言处理
产品应用8

首款推理具身模型,谷歌DeepMind造!自主理解/规划/执行复杂任务,打破一机一训,还能互相0样本迁移技能

谷歌DeepMind发布新一代通用机器人基座模型Gemini Robotics 1.5系列,由GR 1.5和GR - ER 1.5组成,结合视觉、语言与动作,实现“规划 + 执行”闭环,还提出Motion Transfer机制,能跨机器人迁移技能。

量子位
推荐文章7

99%的人都不知道:MCP 必须在 Claude Code 外面装

作者分享飞书MCP安装经验,指出MCP要在Claude Code外安装,介绍用Cursor生成安装命令、验证安装、删除服务等技巧,还整理《MCP安装指令文档》,复制粘贴就能用。

AI 产品自由
产品应用8

阿里Qwen-Image-2.0图像生成与编辑巅峰汇合,超真实、超强图文结合

阿里Qwen - Image - 2.0将生图与编辑能力合二为一。它支持长指令,能精准渲染大量文字,引入物理逻辑让文字呈现真实质感,在生图和编辑上对语义理解和画面重构能力强。

AIGC开放社区
新闻资讯8

通往通用人工智能的关键一步?DeepMind放大招,3D世界最强AI智能体SIMA 2

Google DeepMind发布SIMA 2,这是能在虚拟3D世界自主游戏、推理和学习的通用AI智能体。它集成Gemini模型,从指令跟随到主动认知跃进,泛化性能提升,还具备自我提升能力,为AI和机器人技术发展提供新路径。

机器之心