「多智能体行为生成」共找到 5556 篇相关文章
DeepSeek-OCR 2再进化,对图像理解已经像人一样逻辑推理了
DeepSeek-OCR 2升级,保持前代高效压缩率和解码效率,引入DeepEncoder V2,模仿人类视觉因果流机制,将图像理解转为逻辑推理,在文档解析领域实现逻辑重构,性能显著提升。
Kimi新出的Agent集群,到底有多恐怖?
Kimi发布K2.5模型及Agent集群功能,将国产AI推向“组织智能”新高度。K2.5全能且开源,多项评测优于GPT - 5.2 - xhigh且成本低。Agent集群可按需协调子Agent,实现“角色涌现”与“3D编排”。
跨境电商版Sora发布:全球首个AI原生电商视频Multi-Agent来了
营赛AI发布跨境电商版Sora——inSai Hilight。它无需拍摄素材与复杂提示词,扔个商品链接或图,20 - 30分钟就能生成逻辑严密、商品还原度100%、符合TikTok爆款节奏的营销视频,重新定义电商营销视频生产方式。
DeepMind发布SIMA 2!打通「感知-推理-行动-反思」闭环
DeepMind推出的SIMA 2,可让智能体在虚拟环境中边聊天边进行复杂多模态推理。它整合Gemini能力,从指令执行者变为互动伙伴,有强大迁移泛化与自我提升能力,是迈向AGI重要一步,但也面临一些挑战。
北大卢宗青团队新作:超 70% 实机成功率,支持语言指令的功能性抓取系统
现有抓取研究多在稳定性层面,而功能性抓取更接近真实世界的智能。北大卢宗青团队提出DemoFunGrasp方法,对功能性抓取重新建模,在仿真与真实场景均超70%成功率,还引入视觉语言模型让机器人理解语言指令。
让AI真正懂数据:猫超Matra项目中的AI知识库建设之路
文章聚焦猫超Matra项目的AI知识库建设。猫超数据体系庞大但有治理难题,促使Matra项目诞生,旨在实现智能取数。文中详述知识库设计、实践及效果,还提及未来在准确性、保鲜性和能力拓展上的规划。
NeurIPS 2025|指哪打哪,可控对抗样本生成器来了!
近日,清华大学和蚂蚁数科在NeurIPS上联合提出Dual - Flow新型对抗攻击生成框架。它能从海量图像数据学“通用扰动规律”,对多模型、多类别发起黑盒攻击,为AI安全带来挑战,已用于蚂蚁数科产品。
OpenAI:如何用 Codex 在 28 天内极速打造安卓版 Sora
OpenAI发布工程博客,揭秘用Codex不到一个月打造Sora安卓版应用的过程。这款应用上线首日冲至Google Play下载榜第一,24小时内用户生成超百万视频,开发过程耗约50亿tokens,崩溃率仅0.1%。
港大开源ViMax火了,实现AI自编自导自演
香港大学黄超教授团队开源ViMax框架,在GitHub获高星标。它借助多智能体协作实现AI自编自导自演视频,突破主流模型在长视频制作的瓶颈,采用多种策略应对技术挑战,不过在多方面仍有提升空间。
5张 H800 带来 20 FPS 高保真实时虚拟人生成
传统扩散模型做视频生成速度慢、画面不稳定,难用于实时虚拟人场景。阿里Live Avatar框架将算法和系统一起设计,用TPP并行推理策略和RSFM机制等,5张H800 GPU能实现20 FPS高保真实时虚拟人生成。