「原生多模态架构」共找到 2937 篇相关文章
通用级PixVerse P1的技术突破,揣着进入平行世界的密码
PixVerse R1 突然上线,带来「即时响应、即看即创」新体验。它是全球首个支持最高 1080P 分辨率通用实时世界模型,实现从「静态输出」到「实时交互」跨越,本文将解析其技术突破。
谷歌Veo 3.1更新:更一致性、更具创造力和控制力
谷歌Veo 3.1发布更新,实现角色、背景与物体在动态场景中的高度一致性,支持基于参考图片创建视频、原生竖屏模式及1080p和4K分辨率升频,精准控制素材,提升创作体验。
DeepSeek开源大模型记忆模块!梁文锋署名新论文,下一代稀疏模型提前剧透
DeepSeek最新论文给Transformer加上“条件记忆”,补上原生知识查找机制。梁文锋署名,与北大团队合作。提出全新范式及Engram模块,解决传统N - gram问题,研究稀疏性分配,验证推理能力提升,兼顾工程优化。
英伟达推出下一代计算平台Rubin:可用45°C的热水进行冷却,训练速度提高3.5倍
英伟达黄仁勋在CES演讲,宣布进入自动驾驶领域、推出Alpamo模型与下一代计算平台Rubin。他指出计算行业正经历平台性转变,还介绍AI进展、应用架构,Rubin平台性能强且能效高。
从算法天才到机器人造梦者,原力灵机范浩强详解具身智能进化论:模型解锁场景,场景定义硬件
AI 前线深度访谈原力灵机范浩强,探讨其创业选择、具身智能技术演进与产业趋势。他认为机器人是 AI 绕不过的点,2025 年硬件与算法拼图开始对齐,原力灵机强调算法先行,还分享了保证算法演进的路线。
当AI穿上白大褂:医疗智能体正在重构临床工作流
新加坡等多所高校联合发表医疗智能体综述研究。医疗智能体有感知 - 认知 - 行动闭环,能深入临床长链条工作流。综述剖析其架构、协同机制、应用场景与安全挑战,还探讨评估及发展方向。
从大厂设计师到超级一人公司:6000字回顾我和AI的2025
作者回顾2025年,身份从大厂设计师变为自由职业者,用AI加持做超级一人公司。自媒体上各平台粉丝量增长,开始做视频;社群活动帮创业者和会员;创作涵盖Vibe Coding、Agent、图像视频等;还介绍合作产品,展望2026年AI趋势。
QwenLong-L1.5发布:一套配方,三大法宝,让30B MoE模型长文本推理能力媲美GPT-5
通义文档智能团队推出QwenLong - L1.5长文本推理专家,提供端到端长文本推理后训练“配方”,含数据合成管线、强化学习方法、智能体架构,在多基准测试成绩佳,代码已开源。
分割一切、3D重建一切还不够,Meta开源SAM Audio分割一切声音
Meta 深夜放出音频分割模型 SAM Audio,可通过多模态提示分离任意声音。其核心 PE - AV 推动性能领先,还发布评测模型、基准等,整合进新平台,虽有局限但为音频 AI 带来新可能。
GAIR 2025 「数据&一脑多形」分论坛,激辩 AI 演进路径
在 12 月 13 日 GAIR 大会“数据&一脑多形”分论坛上,探讨了数据价值重构与“一脑多形”架构革命。多位嘉宾围绕具身智能数据、“一脑多形”技术展开分享与讨论,为人工智能发展提供新思路。