「多模态支持」共找到 1366 篇相关文章
北大大牛团队最新顶会,首次让AI能够生成真实火焰
北京大学陈宝权教授团队提出 FieryGS 框架,被 AI 顶会 ICLR 2026 接收。它将多模态大模型、燃烧物理仿真与 3D 高斯溅射融合,首次在 3D 重建中实现物理可信、语义感知且可控的火焰合成,推动数字孪生发展。
GPT-5.2破解数论猜想获陶哲轩认证!OpenAI副总裁曝大动作:正改模型核心设计,吊打90%研究生但难出颠覆性发现
OpenAI 发布由 GPT - 5.2 加持的科研平台 Prism 并免费开放。副总裁 Kevin Weil 称目前模型难有颠覆性发现,但能加速科研。GPT - 5 能力超 90% 研究生,OpenAI 将优化其设计,让它更谦逊并自我核查。
AI引发K型分化:Gemini 3 加剧技术劳动力分化,判断力为王,基础岗位将被AI完全替代,程序员也不例外
2025年11月Google发布Gemini 3,依托多模态MoE架构和“Deep Think”模式,在软件工程等领域实现推理能力质的飞跃。它使前端开发工作重心转移,重构软件工程工作流,赋能白领但带来隐患,还冲击劳动力市场,提升软件掌握门槛。
英伟达新架构引爆全模态大模型革命,9B模型开源下载即破万
英伟达推出全模态大模型OmniVinci并开源,其90亿参数规模性能超同级别甚至更高级别模型,训练数据效率是对手6倍,能精准解析视频和音频,在多模态应用场景中表现卓越,下载量破万。
裁员现在不叫裁员,叫 AI 裁员
当下很多公司出现‘AI裁员’现象,在AI加持下,人员价值被重估。重复性高、难证边际价值的岗位易被裁,公司会加大对与AI相关岗位的投入。中美企业在裁员做法类似,但人才策略不同。
开放全栈!超越π0,具身智能基础大模型迎来真·开源,开发者狂喜
继π0后,具身智能基座模型WALL - OSS正式开源,多项指标超越π0。它是通用多模态具身模型,具良好推理和泛化能力。背后自变量机器人刚完成近10亿A + 轮融资,开源将降低具身智能门槛。
OpenAI/微软争夺AGI控制权!重组谈判激烈,年底谈不成软银700亿或撤
OpenAI与微软就重组问题谈判胶着,核心在控制权与确定性,如多云是否松口、微软能否获取训练细节、AGI条款去留。这影响微软持股价值和软银投资,年底是关键节点,若重组未完成,软银或撤回100亿美元。
字节Seed提出M3-Agent:像我们一样"记住"与"思考"的长视频理解新范式
字节Seed提出M3 - Agent,这是首个融合实时视听输入、类人记忆构建与自主推理的多模态智能体。它模仿人类记忆机制,解决长视频理解痛点,已被CVPR 2025收录并开源代码,为通用人工智能奠定基础。
AI浏览器必火!
AI浏览器是面向大众的AI Agent,能满足智能搜索与总结、自动化任务、多模态交互等需求。目前赛道竞争激烈,作者认为Perplexity Comet是最佳产品,能处理网页内容、自动化操作,AI浏览器有望成首个杀手级AI应用。
拳打可灵,脚踢 Veo 3,谁是物理世界的「懂王」?
多模态视频生成大模型是复杂系统工程,多为巨头游戏。MiniMax的Hailuo 02发布,ELO得分超谷歌Veo 3和快手Kling 2.0。它能呈现复杂运动,处理物理关系,提升训练推理效率,成本低,后续还将更新。