「视频具身基座模型」共找到 8092 篇相关文章
央企怎么做超级智能体?对谈中电信天翼AI:自研模型为底座,自主规划是必须,能适应千行百业才行
中国电信天翼AI发布星辰超级智能体,获2025企业级AI Agent榜单央企第一。它依托自研“星辰大模型”,具备全模态、复杂推理等能力。访谈专家指出智能体可直接产出应用,落地需嵌入主业系统,电信持续迭代模型优化它。
蚂蚁具身智能明牌了:做大脑,和宇树们错位竞争
蚂蚁灵波开源具身智能基座模型LingBot-VLA,用20000小时真实世界数据训练,解锁最大规模开源真机数据之一。它性能超国际顶尖模型,还指明通用具身智能发展路径,为行业提供全栈解决方案。
让AI像人类画家一样边画边想,港中文&美团让模型「走一步看一步」
在文生图和视频生成领域,现有模型处理复杂任务常出错。港中文和美团团队提出TwiG范式,将视觉生成拆解为“生成-思考-再生成”循环,经实验验证有效,有望拓展到更多领域。
终结多智能体视觉幻觉“滚雪球”!新国立等提出ViF:无需改造模型,即插即用
多智能体协同做视觉任务常轮次越多错得越离谱,根源是信息传递方式有缺陷。新国立等研究人员提出轻量通用的ViF范式,无需改造基座模型,可大幅压制幻觉滚雪球,已入选ICLR 2026。
6666!NuerIPS满分论文来了
NuerIPS唯一满分论文结论惊人,指出真正决定推理上限的是基座模型本身而非强化学习,且蒸馏比强化学习更有望实现大模型自我进化,这给正火热的RLVR泼了冷水。
UofT、UBC、MIT和复旦等联合发布:扩散模型驱动的异常检测与生成全面综述
多伦多大学、麻省理工学院等高校研究者合作完成长文综述,聚焦扩散模型在异常检测与生成领域的应用,梳理图像、视频等异常检测任务进展,提供分类体系,展望未来趋势。
谷歌AGI底座降临!首个原生全模态嵌入模型上线,已实现全模态SOTA
谷歌发布首个原生全模态 Embedding 模型 Gemini Embedding 2,将文本、图、音视频及 PDF 融于统一向量空间,实现跨模态检索,降低架构成本,赋予 AI 连贯「记忆」,是重塑 AI 基建的里程碑。
大事不好!机器人学会预测未来了
蚂蚁灵波连续四天开源,此次推出全球首个用于通用机器人控制的因果视频 - 动作世界模型LingBot - VA。它能脑补未来,有记忆不丢失、高效泛化等亮点,架构设计独特,实验效果出色,推动通用机器人走向视频时代。
11Labs 增长负责人:搞营销要学着做视频,但创始人出镜会有点自恋
AI语音独角兽ElevenLabs增长迅猛,估值超30亿美元。其增长负责人Luke Harries分享独特策略,如分业务单元管理、重视视频营销、多渠道推广等,还给出团队搭建、产品发布等实用建议。
从“卷模型”到“算总账”:AI 产业竞争开始拼什么 | 请回答 WAIC 2026
WAIC 2026热度高涨,InfoQ直播间追问‘AI正在重写什么’。与会嘉宾讨论AI产业新阶段变化,如从‘看能力’到‘算总账’,认为模型重要性方式已变,还探讨了AI原生产品定义、AI Infra影响及未来关注方向。