模型能力连续体」共找到 8966 篇相关文章

新闻资讯8

黑马图像模型被Nano Banana技术负责人点赞!15人华人小队,DDIM之父&CVPR最佳论文作者带队

Luma AI推出全新图像模型Uni - 1,对标谷歌Nano Banana Pro和GPT Image 1.5。它是统一图像理解与生成模型,多项评测表现出色。背后是不到15人的华人团队,由DDIM之父和CVPR最佳论文作者带队。

量子位
新闻资讯8

神秘爆款模型被小米认领!雷军直言超过马斯克 xAI Grok,罗福莉透露MiMo-V2-Pro将开源

小米发布 MiMo-V2 家族三款新模型,确认 Hunter Alpha 是 MiMo-V2-Pro 早期版本。雷军称其超马斯克 Grok,罗福莉透露模型稳定后将开源。MiMo-V2-Pro 适用于 Agent 场景,Omni 关注全模态交互,TTS 面向语音生成。

InfoQ
开源动态7

DeepSeek之后:中国开源人工智能生态的架构选择

自2025年1月“DeepSeek时刻”,中国开源社区有历史性进展,讨论焦点从模型转向架构与硬件选择。技术架构多元,多模态能力扩展,开源许可宽松,小模型走红,本土硬件采用加快。

Hugging Face
开源动态8

LeRobot v0.4.0 正式发布:全面提升开源机器人的学习能力

LeRobot v0.4.0 正式发布,带来多方面重大升级。有可扩展的 Datasets v3.0、新 VLA 模型、全新插件系统;支持 LIBERO 和 Meta - World 仿真;还有数据处理 Pipeline、多 GPU 训练简化等特性,上线了机器人学习课程。

Hugging Face
新闻资讯8

LeCun亲自官宣!Meta世界模型V-JEPA 2登场!仅用62小时机器人数据,就能实现零样本控制!

Meta发布V-JEPA 2世界模型及三个新基准测试,Meta首席AI科学家Yann LeCun介绍其不同。V-JEPA 2基于视频训练,用62小时机器人数据就能实现零样本控制,还将探索分层式模型和多模态建模。

AI科技大本营
新闻资讯8

GPT-5.4「原生操控电脑」实测封神!OpenClaw天选模型来了

OpenAI发布GPT-5.4,首次实现原生电脑操控能力,几乎可操作电脑所有应用。它被认为是最适合跑OpenClaw的模型,在多方面表现出色,其发布标志AI从对话式到智能体的跨越。

新智元
算法论文8

视觉模型既懂语义,又能还原细节,南洋理工&商汤提出棱镜假说

南洋理工与商汤团队提出 Prism Hypothesis(棱镜假说)与 Unified Autoencoding(UAE)。论文指出视觉基础模型中语义理解和像素保真很难兼得,用频率谱统一视角解决冲突,UAE 实验效果良好。

机器之心
新闻资讯8

李飞飞最新长文火爆硅谷

AI教母李飞飞发表长文,首次系统性解释空间智能,提出真正具有空间智能的世界模型须具备生成、多模态、交互三个核心能力,还分享World Labs进展及世界模型在多领域的潜力。

量子位
产品应用8

文心X1.1三大能力狂飙,海内外实测还挺惊艳!

9日WAVE SUMMIT深度学习开发者2025大会上,文心大模型X1.1发布,事实性、指令遵循、智能体能力显著提升,多项测试表现佳。它能做到知识一致,精准遵循指令,智能体解决问题出色,代码、数学、多模态能力也有进化,得益于迭代式混合强化学习训练框架。

新智元
算法论文8

牛津VGG、港大、上交发布ELIP:超越CLIP等,多模态图片检索的增强视觉语言大模型预训练

牛津VGG、港大、上交大团队论文提出ELIP方法,用学术界资源增强视觉语言大模型预训练,用于文字 - 图片检索。该论文被大会接受并获最佳论文提名。ELIP可应用于多个大模型,实验显示能显著提升图片检索表现。

机器之心