「视频 - 音频联合生成」共找到 2051 篇相关文章
黄仁勋提前锁定20年OpenAI芯片收入!第一轮150万GPU卖2000亿美元
英伟达推出‘LPS’概念,联合投资机构出5000亿美元建数据中心,为客户担保。首个项目为在美为OpenAI建150万GPU数据中心,20年或带来巨额芯片收入。黄仁勋也对相关风险做了澄清。
美国开源被中国甩在身后,套壳创业者更遭惨烈清算!OpenRouter CEO:天天乱用高价AI的员工要小心了
顶级科技播客20VC访谈OpenRouter联合创始人兼CEO Alex Atallah。他指出美国开源大模型落后中国,企业怕依赖巨头,AI时代员工成本应动态化,还探讨了模型生态、路由技术等行业热点。
CVPR 2026 三维视觉趋势梳理:从 RGB 感知,到真实世界建模
计算机视觉行业从追求识别能力转向关注视觉系统对真实世界的理解。CVPR 2026研究中,多视角、事件视觉、开放集3D生成和相机运动轨迹被引入视觉理解,多篇论文从不同侧面推动视觉系统走向对真实世界的理解。
干掉 .md?兜里 Token 不够,没法和 Karpathy 共情
近日,围绕‘Markdown 是否已过时’讨论升温。Theo Browne 视频阐述‘HTML 优于 Markdown’五大理由并分享实操技巧,虽指出 HTML 有费 Token、版本控制差问题,但仍倾向用 HTML,不过也有开发者质疑。
MiniCPM-o 4.5 技术报告发布:全双工全模态 API 开放,RTX5070 即可实时运行
面壁智能等发布 MiniCPM-o 4.5 技术报告,开放全双工全模态 API。该模型 9B 参数,RTX5070 可实时运行,下载量超 25 万。报告披露 Omni - Flow 框架,模型性能强,还能催生新应用。
这家公司刚成立7个月,正在打磨通用具身智能的终极形态
超维动力(Kinetix AI)于2025年7月注册,9月研发,不足一年便举办独特发布会,让KAI人形机器人“自己发布自己”。其认为高拟人是训练强世界模型前提,构建了含本体、世界模型等的技术体系,但面临工程与成本挑战。
Agent记忆赛道大洗牌!LoCoMo-Refined重磅发布,主流记忆框架迎来核心检验
南京大学与上海人工智能实验室联合推出 LoCoMo-Refined,这是严苛的 Agent 记忆评测基准。它指出当前记忆评测基准有两大漏洞,在其标准下主流记忆框架得分普降,且相关数据集和评测脚本已开源。
盛大AI研究院新作:流式生成超越非流式,一句话让虚拟人动作丝滑如真,推理延迟仅1帧
盛大AI研究院与东京大学联合提出FloodDiffusion,首个基于定制化扩散强制的流式人体动作生成框架。它能零延迟生成无限长动作序列,解决了现有方法的问题,在多数据集评估中表现优异。
小米AI语音新框架:人人都能当声音导演
小米大模型应用团队提出Midasheng - audio - generate与Xiaomi Any2Speech两大音频生成框架。前者可实现全场景声音重建,后者让AI学会理解声学空间与叙事逻辑,改变了语音合成应用场景与思路。
Anthropic训了一个10万亿参数的模型,然后说:太危险了,不卖
Anthropic发布10万亿参数新模型Claude Mythos,因其网络安全能力过强不公开发布,联合12家科技巨头开展Project Glasswing计划,让企业用其查系统漏洞。模型性能提升显著,还能突破沙箱,引发各方关注。