「多模态大模型」共找到 9346 篇相关文章
可灵2.5Turbo实测|顶尖AI视频模型,真能打平CG吗?
可灵发布2.5 Turbo版本视频模型,进步显著,提示词理解、高速动态表现、风格稳定性都有提升,价格还更划算。经多场景测试,其在特定场景下内容质量能与CG媲美,开始理解动作背后逻辑。
数据减少超千倍,500 美金就可训练一流视频模型,港城、华为Pusa来了
香港城市大学与华为香港研究所合作推出 Pusa 项目,它基于 FVDM 理论,可极低成本微调大规模预训练视频模型,成本降超 200 倍、数据减少超 2500 倍,代码已开源。
阿里“快乐马”团队再出手!正面叫板谷歌 Genie 3,世界模型 HappyOyster 来了
4月16日,阿里发布世界模型产品HappyOyster,由ATH创新事业部团队研发。它与谷歌Genie 3同属世界模拟器流派,采用长跨度世界演化建模,有漫游和导演两大核心能力,在多方面呈现差异化优势。
6666!NuerIPS满分论文来了
NuerIPS唯一满分论文结论惊人,指出真正决定推理上限的是基座模型本身而非强化学习,且蒸馏比强化学习更有望实现大模型自我进化,这给正火热的RLVR泼了冷水。
刚刚,阿里CEO吴泳铭发布「ASI宣言」:超级智能才是终局!
阿里巴巴CEO吴泳铭发布「ASI宣言」,认为AGI仅是序章,ASI才是终局。阿里云有两大战略路径,通义千问家族模型性能提升,如Qwen3 - Max超越GPT - 5,各模型在不同领域有出色表现。
OmniHuman-1.5:让数字人拥有“思考”的视频生成新范式
现有视频数字人模型难捕捉角色本质,字节提出 OmniHuman - 1.5 框架。其核心创新是用 MLLM 提供语义引导、提出多模态 DiT 架构和伪末帧设计,使模型融合多模态信号,生成高质量角色动画。
GPT-5、Grok 4、o3 Pro都零分,史上最难AI评测基准换它了
AAI机构提出新基准FormulaOne,让GPT - 5、o3 Pro等前沿大模型集体得零分。该基准含220个图结构动态规划问题,分三类难度。测试结果显示,模型在深层及最深层难度表现差,引发关注。
前端危!Gemini 3内测结果获网友一致好评,“有史以来最强前端开发模型”
谷歌下一代旗舰模型Gemini 3未发布便走红,内测结果显示它擅长前端、SVG矢量图生成,多模态能力更强。网友实测其在编程、绘图等方面表现出色,疑似谷歌内部文件显示发布时间为10月22日。
英伟达为机器人推出懂推理的“大脑”!升级版Cosmos世界模型来了
在SIGGRAPH大会上,英伟达推出全新升级的Cosmos世界模型,重点升级规划能力与生成速度。还升级配套软硬件,如Omniverse库等。英伟达全力布局机器人领域,认为图形与AI融合将变革该领域。
卡帕西李飞飞辛顿都投了的Transformer专用芯片,签下10亿美元大单
Etched是只做Transformer专用芯片的创业公司,获卡帕西、李飞飞、辛顿投资。它宣布流片成功,筹集8亿美元,获10亿美元客户大单,还推出一整套面向前沿模型推理的集群系统。