「多模态生成」共找到 2912 篇相关文章
九天大模型大变身:性能狂飙35%!还能一键P大象
7月26日,中国移动在2025世界人工智能大会发布「九天」基础大模型3.0,端到端技术全面升级,复杂推理能力提升35%,智能体调用效率提升21%,还推出代码、数学等专项大模型,多模态能力也焕新。
实测全新 SkyReels :AI 创作,终于连成了一体
当前AI生成技术虽强,但视频创作仍门槛高、流程琐碎。昆仑万维推出全新SkyReels,是多模态创作系统,AI科技评论实测其画布、Agent等功能实用,它依托统一框架,核心竞争力在实现“统一性”。
全日程公布|谷歌Veo 3惊艳发布后,这场CVPR分享会值得每个AI人「听个声」
谷歌在 I/O 2025 大会发布 AI 视频生成模型 Veo 3,实现音画同步。为让从业者了解 AI 新成果与趋势,机器之心 6 月 8 日将举办「CVPR 2025 论文分享会」,公布全日程、嘉宾及主题,还会直播。
三维空间太难懂?RoboTracer让机器人理解复杂空间指令,推理3D空间轨迹,开放世界也能精确行动
家庭环境复杂,让机器人理解空间指令难,现有VLM多聚焦2D推理。北航、北大等联合推出多模态大模型RoboTracer,能精准生成3D轨迹,在多项评测中领先,还能直接集成到机器人,完成复杂任务。
南洋理工 | 推出开源版MetaQuery:OpenUni,1.1B参数媲美BLIP3-o-8B
南洋理工大学 S-Lab 和商汤科技团队推出开源版 MetaQuery——OpenUni,仅 1.1B 参数就达 8B 模型性能。它架构极简、参数高效且完全开源,还采用两阶段训练策略,虽有局限但为多模态模型研究助力。
谷歌深夜双发!最便宜Nano Banana来了
谷歌深夜上线Nano Banana 2 Lite和Gemini Omni Flash。前者是最快最便宜文生图模型,4秒生图且成本低;后者是视频生成模型,支持多模态输入和对话式编辑。二者串联打通创作流水线,还集成SynthID水印技术。
和快手聊了之后才知道,传统搜索早变天了
文章从工程师视角剖析现代搜索,指出传统搜索难适应多模态内容世界。快手推出 UniDex 和 UniSearch,前者变革搜索倒排,后者为统一生成式搜索架构,二者成快手新一代工业搜索‘双引擎’,有广阔应用前景。
文档秒变演讲视频还带配音!开源Agent商业报告/学术论文接近人类水平
澳大利亚和英国多所高校团队提出多模态智能体PresentAgent,能将文档转化为配有语音讲解和同步幻灯片的视频演示。其模块化生成框架有可控性和领域适应性,评估显示它在各指标上接近人类水平。
大模型被确诊「视觉文盲」!多校联合提出MILO,为它植入空间想象力
空间推理是多模态大语言模型(MLLMs)应用关键挑战,当前‘语言描述式调优’让模型成‘视觉文盲’。多校联合提出MILO范式,结合视觉生成反馈与语言调优,还构建GeoGen数据集,经五大任务验证其有效。
1.5B参数!支持本地实时语音转录
Liquid AI发布首个端到端音频基础模型LFM2 - Audio - 1.5B,参数1.5B,能在本地设备处理高质量端到端音频任务。它是统一多模态模型,支持两种生成策略,多种应用场景,虽仅支持英文但性能出色。