「多主体视频生成」共找到 2698 篇相关文章
非Transformer架构的新突破,液态神经网络的推理小模型只用900M内存
谷歌提出的Transformer架构基本垄断大模型,而初创公司Liquid AI研发的液态神经网络架构另辟蹊径。其发布并开源的LFM2.5 - 1.2B - Thinking模型,仅需900MB内存就能在端侧运行,性能优于Transformer架构模型,还降低了死循环生成比例。
大模型手语翻译新进展:CAPO-SLT拿下中文三项最高分 | EMNLP'26
vivo AI Lab团队针对自动手语翻译生成中,无视觉证据支撑的错误累积导致语义偏移的痛点,提出置信度感知策略优化方法CAPO-SLT,仅调整强化学习更新规则,不修改主干网络,在中文手语翻译测试中拿下三项指标最高分,成果将发表于EMNLP'26。
前百川联创下场、字节腾讯入局,到底谁在看好 AI 播客?
近期前百川智能联创焦可的‘来福’、前妙鸭相机产品负责人张月光的 ChatPods 等 AI 播客产品上线。‘来福’播客全由 AI 生成,国内多款同类产品也相继登场。虽产品效果能达及格线,但在多数播客场景难替代现有内容。
通过零开销逐层权重卸载技术将SGLang Diffusion wan2.2的推理速度加速60%
文章介绍在优化SGLang对Wan2.2视频生成模型支持时,发现双Transformer架构下第1步和第19步推理慢的问题。通过零开销逐层权重卸载技术,将整体推理速度提升60%,还突破显存墙,且该优化可扩展到其他模型。
暴走东京电玩展,Game Show也AI上了
东京电玩展上,网易、腾讯等中国游戏厂商摆大展台,AI厂商也秀出肌肉。阿里展出通义千问和通义万相,拿出大模型商用化方案;3D生成受关注,混元3D、VAST Tripo等受游戏厂商青睐;AI陪玩HakkoAI海外首秀成绩亮眼。
压缩之外,Visual Tokenizer 也要理解世界?
MiniMax和华中科技大学发布视觉tokenizer新研究VTP,引发业界热议。该研究揭示传统仅以重建为目标的视觉tokenizer缺乏高层语义表示,提出在预训练中引入语义理解,还发现Scaling Law现象,虽有争议但为研究提供新视角。
Skill Factory:三天手搓面向Harness设计的技能工厂(附AI coding实践)
作者分享从产品设计到算法落地全流程实践,指出当前做skill两种方式的问题,介绍面向Harness设计的技能工厂,包括生产模式、生态适配、迭代方向,还提及AI coding实践及各工具作用。
把PLC仿真搬进浏览器,小参数模型也能实现高工程通过率
上海交通大学联合Sema研究团队推出SemaPLC,将AI Agent与PLC工程工具链连接,让自然语言需求转化为可编译、验证、仿真的控制程序。它是面向全流程的智能工作台,实验效果优于业界方案。
李飞飞刚立规矩才13天,国产卡上「真物理」就来了!
李飞飞为「世界模型」立规矩13天后,中国「草根」团队Mogo推出全球首个具备高动态物理交互能力的世界模型Magpie 1.0,在国产芯片上实现超10分钟物理一致性,开辟全新技术路径。
12毫秒暴露自动驾驶致命缺陷,北航新研究实现场景感知的动态物理对抗攻击|TPAMI2025
近日部分L3级自动驾驶车型获批上路,但自动驾驶感知系统存在缺陷。北航等机构提出DynamicPAE框架,实现场景感知的动态物理对抗攻击,解决多维度挑战,在多场景表现优异,被TPAMI2025录用。