「文本驱动动作生成」共找到 1298 篇相关文章
一文彻底看懂 Google 最新开源 A2UI 协议:如何让 AI Agent “说出UI” ?
本文深入解读Google最新开源的A2UI协议,它让AI Agent学会“说UI的语言”,用安全、声明式格式将UI需求发至前端渲染。文中分析Agent UI面临的挑战,介绍A2UI设计思想、工作流程,还提及它与AG - UI、CopilotKit的关系及未来展望。
沉默的进化:LatentMAS 如何通过“潜意识通信”重塑多智能体协作?
这是对多智能体协作领域突破性研究的深度解读。论文提出LatentMAS框架,让智能体直接交换“思维向量”,实现“机器心灵感应”,在性能、速度和Token消耗上全方位碾压传统文本交互模式。
一句话画出整张架构图?这款 2k star 开源 AI 画板,真能帮你告别熬夜改流程图吗?
Smart Excalidraw是基于Excalidraw的智能绘图工具,用自然语言就能绘制专业图表。它能解决传统绘图语法难记、排版耗时等痛点,具备AI驱动、独创连接算法等功能,适合多类人群使用。
Meta「分割一切」进入3D时代!图像分割结果直出3D,有遮挡也能复原
Meta MSL实验室发布三维重建模型SAM 3D,其家族的两个新模型能将2D图像转为3D重建模型,性能优异。同时,此前投稿ICLR 2026的SAM 3也亮相,可克服传统模型局限,在多项任务中刷新SOTA。
告别「一条路走到黑」:通过自我纠错,打造更聪明的Search Agent
为解决知识实时性和推理复杂性挑战,搜索智能体(Search Agent)应运而生,但缺乏自我纠错能力。腾讯联合清华提出 ReSeek 框架,引入动态自我修正机制,还构建 FictionalHot 数据集评估,实验效果良好。
从VLA到RoboOmni,全模态具身新范式让机器人察言观色、听懂话外音
复旦大学等联合推出全模态端到端操作大模型RoboOmni,统一多模态,实现动作与语音协同控制。它重新定义机器人交互范式,让机器人具备“察言观色”能力,还构建了OmniAction数据集,实验表现全面领先。
大模型公司不搞浏览器搞Agent,实测找到原因了
文章实测阶跃星辰桌面Agent小跃,它能操作命令行,可自然语言驱动计算机功能,有悬浮球形态,能联网、搜索、处理表格等,还支持复用操作、定时任务,但也存在速度慢等不足。
字节发布通用游戏智能体!5000亿token训练,用鼠标键盘吊打GPT-5!
字节seed团队打造通用游戏智能体Game-TARS,基于键盘—鼠标动作空间训练,用超5000亿标注量级数据,结合新技术提升扩展性和泛化性,在多类游戏任务中表现超越GPT - 5等模型。
阿里新研究:统一了VLA和世界模型
阿里达摩院等提出WorldVLA框架,融合视觉语言动作模型与世界模型。它用三套分词器编码,解决传统自回归模型问题,经联合训练,实验显示其性能优,两模型还能相互助力。
18.2K Star!macOS 丝滑跑Linux,一键容器、多架构支持,开发效率直接起飞!
介绍轻量级虚拟机管理器 `Lima`,它能在 macOS 上提供类似 WSL2 的体验,专注容器化工作流。支持多架构与多驱动,有开箱即用的容器化支持等特性,安装和使用简单。