「多模态融合」共找到 1364 篇相关文章
通用Agent是伪命题?昆仑万维方汉现场拆解:垂直推理才是胜负手|新智元十年峰会
在新智元十周年峰会上,昆仑万维董事长方汉分享公司转型故事与多模态AGI见解。他认为通用Agent非万能,垂类推理数据是关键,还提出AI商业落地逻辑,展示多款产品成果。
Meta和Scale AI闹翻!砸143亿买的高管跑路,业务也合作不下去
两个多月前,Meta豪掷143亿美元收购Scale AI 49%股份,如今双方在团队融合、业务合作方面产生纠葛。原Scale AI高管离职,Meta研究人员抱怨其数据质量低。双方后续发展不尽如人意。
清华团队开源发布首个结构化数据通用大模型
2025年8月29日,清华崔鹏教授团队联合稳准智能开源“极数”(Limi X)结构化数据通用大模型。它融合结构因果推断与预训练技术,适配多任务,性能超最优专用模型,已落地多个工业场景。
构建会“说话”和“行动”的 AI:生成式数字人技术与 EchoMimic 实践
在 QCon 全球软件开发大会上,支付宝李宇明围绕 EchoMimic 介绍生成式数字人进展、技术、应用及研究思路。对比传统数字人,生成式数字人成本低、易控制,但也有技术新、推理成本高的问题。EchoMimic 两版本已开源,经优化推理速度可提升。
在WAIC现场,全球首个拥有「原生记忆力」的大模型亮相,但不是Transformer
在WAIC上,RockAI推出基于非Transformer架构Yan 2.0 Preview的多模态大模型,有原生记忆能力。它在性能指标上优势明显,其记忆机制接近生物方式,团队秉持理念推动离线智能,获硬件厂商关注。
实测爆火的阶跃星辰Step 3,性能SOTA,开源多模态推理之王
在 WAIC 2025 前一天,阶跃星辰推出新一代基座模型 Step 3,它是开源 VLM 新晋之王,性能超同类别开源模型,与顶尖闭源 VLM 也有一战之力。该模型具备多开好省特点,还展示了宏大技术生态与商业化布局。
AI 编程冲击来袭,程序员怎么办?IDEA研究院张磊:底层系统能力才是护城河
在AICon全球人工智能开发与应用大会上,IDEA研究院张磊接受专访,剖析多模态智能体落地路径,分享平衡研究与产品的见解,还为年轻人在AI浪潮中发展给出建议,指出底层系统能力是关键。
Liblib AI上线Kontext,门槛大幅降低!藏师傅手把手教你用它解决图片问题
FLUX的Kontext是强大的图像编辑应用,除不能写中文外近乎全能。Liblib AI上线FLUX Kontext,支持Web UI和Comfyui,无需本地跑Comfyui,还能结合Liblib生态处理图片。作者给出保姆级使用教程。
新赋能•创生态 | 首钢园“产业跃升计划”发布会举办
在数字浪潮下,新质生产力成核心变量。5月28日,首钢园“产业跃升计划”发布会召开。其正构建“1+3+X”产业体系,园区已聚800余家科创企业。会上多位专家分享,还签约伙伴构建企业全生命周期服务体系。
视频推理界的“福尔摩斯测试”:所有大模型,统统不及格 | 论文代码开源
腾讯ARC Lab和香港城市大学推出Video - Holmes,这是视频推理界的‘福尔摩斯测试’,能展现多模态大模型复杂视频推理能力的边界,规避现有Benchmark痛点,测试中所有大模型全部不及格,代码已开源。