「图驱动规划」共找到 1183 篇相关文章
昆仑万维多模态视频生成开源,影音图文全统一
昆仑万维开源的SkyReels-V3,通过统一多模态上下文学习框架,实现参考图像生成视频、视频持续扩展及音频驱动虚拟数字人功能,在视觉质量与指令跟随性上逼近闭源顶尖水平,为开源社区提供强大研究基座。
AI看不到的爱心,成了最棒的AI检测器。
作者以漂浮爱心图检测AI,Gemini 2.5 Pro、GPT - 5等模型均失败。又用噪点鹿视频测试,AI准确率为0%。原因是AI是空间王者、时间瞎子,无“共同命运法则”视觉系统,存在时间盲视。
X-Actor 惊艳登场!长时唇动+情感同步人像动画生成
字节提出 X - Actor,一个音频驱动自回归扩散框架,能通过一张静态参考图像和一段音频生成逼真、富有情感表达的人像动画视频。其核心是两阶段解耦生成流程,实现长时间唇形同步与情感音频一致性。
MCP 核心宝典 | 2025 最新最全!经典MCP案例实操讲解!必读!
文章介绍2025最新版MCP说明手册,阐述MCP是让AI模型无缝交互的标准化接口和框架,解决AI与外部连接难题。还给出实操案例,如本地构建MCP项目、实现MCP驱动的代理式RAG搜索向量数据库。
田渊栋:连续思维链效率更高,可同时编码多个路径,“叠加态”式并行搜索
AI大牛田渊栋团队利用连续空间“叠加态”让大模型并行推理,提升图可达性等任务表现,为连续思维链提供理论支持。还设计注意力选择器等机制,实验显示连续思维链模型准确率更高。此外,田渊栋还是科幻小说家。
打破具身世界模型可执行性鸿沟 !港中深-跨维智能团队提出EVA框架,用强化学习让视频世界模型真正“动”起来
近期,利用视频生成模型为机器人构建“世界模型”成热门路线,但存在“可执行性鸿沟”。港中深 - 跨维智能团队提出 EVA 框架,用强化学习优化视频生成,实验显示其能提升视觉规划、仿真任务成功率及真实部署稳定性,还有数据合成潜力。
痛点突破:YOLOv26引入AAttn区域注意力机制,精度提升1.3个百分点
文章介绍YOLOv26引入AAttn区域注意力机制,解决传统机制在复杂场景下的不足。它通过划分特征图区域学习权重,提升检测精度,且实现简单。经实验验证,精度提升显著,还给出实现细节与优化建议。
2026“企业 Agent 上岗元年”?零一万物六大判断定义企业多智能体,不再沿用大厂标准化产品模式”
1月5日,零一万物发布《中国企业智能体2026六大预判》,展示“万智2.5企业多智能体”。基于实践总结六大核心预判,还升级万智平台,不沿用大厂标准化模式,规划企业多智能体进化“三步走”布局。
卧底硅谷AI独角兽60天:没有KPI,自觉996,不接受远程办公
本文揭秘了AI编程独角兽Cursor早期工作氛围。它招人不走寻常路,无KPI但员工自发996。产品聚焦提升专业开发者能力,奉行Dogfooding文化。靠使命驱动,两年成业界黑马,重产品轻利益。
openJiuwen社区首发Team Skills,定义Coordination Engineering新范式
文章围绕多智能体系统协作问题,指出传统任务编排方式的局限。华为JiuwenClaw团队发布Coordination Engineering新范式,通过Agent Team、Team Skills等能力,解决团队组建、技能沉淀、复用及进化等问题,并以旅行规划为例展示实战效果。