「飞桨v3.2」共找到 3677 篇相关文章
LeRobot v0.4.0 正式发布:全面提升开源机器人的学习能力
LeRobot v0.4.0 正式发布,带来多方面重大升级。有可扩展的 Datasets v3.0、新 VLA 模型、全新插件系统;支持 LIBERO 和 Meta - World 仿真;还有数据处理 Pipeline、多 GPU 训练简化等特性,上线了机器人学习课程。
被“网暴”两个月后,Yann LeCun 携最新世界模型杀回!小扎千万美元激励抢人,Meta AI 内部权利之争开始
Meta推出新的“世界模型”V-JEPA 2,可提升AI物理推理能力。它是V-JEPA扩展版,在百万小时视频上训练,能让机器人完成任务。Meta还发布三项基准测试,且已开源。LeCun力挺,小扎为追进度亲自招人才。
欧洲版DeepSeek发布Mistral 3系列模型,多模态端云生态,无差别商用交付给全球开发者
欧洲最强AI公司Mistral AI发布全系开源模型Mistral 3,从675B到3B参数打通智能链路,采用先进架构,与业界合作优化,以Apache 2.0协议交付全球开发者,推动开源智能发展。
1句话高质量生成游戏3D动作,北大新方法刷新动画制作SOTA
北京大学提出ReMoMask:基于检索增强生成的Text - to - Motion框架,集成三项关键创新。在标准基准测试上,相比RAG - T2M,在HumanML3D和KIT - ML上FID分数分别提升3.88%和10.97%。
3D-R1重塑三维视觉语言推理!让三维交互更智能
近年来,视觉 - 语言模型在2D图像理解有突破,但3D视觉语言模型面对复杂场景不足。为此上海大学团队提出3D - R1模型,它基于新数据集和策略构建,有强多任务三维理解能力,不过也存在进步空间。
【博客翻译】使用PyTorch加速生成式AI第四部分:Seamless M4T,快速优化
这是使用纯原生PyTorch加速生成式AI模型系列博客的第四部分,专注加速FAIR的Seamless M4T - v2模型。通过torch.compile + CUDA Graph,在不损失精度下实现text decoder模块2倍、vocoder模块30倍加速,端到端推理2.7倍加速。
杨植麟带 Kimi 团队深夜回应:关于 K2 Thinking 爆火后的一切争议
上周,月之暗面发布并开源 Kimi K2 Thinking,主打“模型即 Agent”,引发广泛关注。今日凌晨,杨植麟等团队成员在 Reddit 开展 AMA 活动,回应 K2 Thinking 相关问题,如 KDA 机制应用、训练成本、速度与准确性平衡等。
一张图0.1秒生成上半身3D化身!清华IDEA新框架入选ICCV 2025
清华和IDEA研究人员提出新框架GUAVA,可0.1秒从单图创建上半身3D化身。它解决了现有方法在ID一致性、效率等方面的局限,实验显示其在渲染质量和效率上优于现有2D和3D方法,代码已开源。
终于轮到 AI 上夜班了,我去睡
Qoder 推出 Qwen3.7-Max 和 Qwen3.7-Plus 错峰折扣,白天 08:00 到 22:00,Qwen3.7-Max 5 折;22:00 到次日 08:00,Qwen3.7-Max 2 折,Qwen3.7-Plus 4 折。作者测试后认为适合内容创作者,还给出使用建议。
2.4K Star!小米最新开源!覆盖600+语种的语音克隆TTS,40倍实时合成速度!
小米k2 - fsa团队开源OmniVoice,这是支持600 + 语种的零样本语音克隆TTS模型,性能超ElevenLabs v2和MiniMax等标杆,RTF低至0.025,合成速度快40倍,还支持声音设计等功能。