开源动态8
小米开源音频语言模型MiMo - Audio
开源AI项目落地
AI 摘要
小米开源MiMo - Audio音频语言模型,预训练超1亿小时。它能理解和生成音频,在多基准测试达SOTA,音频理解和复杂推理分别超Gemini - 2.5 - Flash、GPT - 4o - Audio,支持多模态任务。
阅读原文 · 开源AI项目落地
牛!小米开源「音频语言模型」,超1亿小时预训练时间,音频理解和输出能力是真顶!
小米推出开源音频语言模型MiMo - Audio,有超1亿小时预训练时间。它能理解音频,70亿参数模型在多基准测试达SOTA,音频理解超Gemini - 2.5 - Flash,复杂推理优于GPT - 4o - Audio,还支持多模态任务。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
开源动态8
DSH - better - sidebar 让 DeepSeek Harness 操作更便捷
DeepSeek Harness 是 AI Agent 运行框架,自由度高但默认 Web UI 操作不便。社区插件 DSH - better - sidebar 迅速出圈,装了侧边工作台,整合多样工具,更新勤,适合折腾 DSH 的人。
开源星探
开源动态8
Genspark开源免费AI办公套件GenOffice
Genspark团队开源AI办公套件GenOffice,全平台免费无广告。它界面类似微软Office,零成本上手,AI能直接编辑文档。虽处Alpha阶段,但可切换多种模型,还给出了配置第三方模型的方法。
CourseAI
开源动态8
Noiz AI发布可交互音视频世界模型
过去两年视频生成模型不断提升画面参数,但传统模型生成的视频固定,用户无法干预。而世界模型可跟随操作实时渲染、动态生成世界。目前Noiz AI联合多机构发布实时可交互音视频世界模型HelixWorld 1.0,后续还将开源。
量子位
开源动态7
DeepSeek V4 Pro与Harness上线,后者似AI系统雏形
DeepSeek V4 Pro正式版0813上线,升级Agent能力,网页、API、app皆可用。DeepSeek Harness亮相并开源,基于“一切皆插件”理念。V4 Pro跑分部分能力突出但价格将涨,其实际表现待更多测试。
AI寒武纪