「中国开源模型」共找到 9291 篇相关文章
开源DeepSeek R1增强版:推理效率快200%,创新AoE架构
德国TNG公司开源DeepSeek R1增强版DeepSeek - TNG - R1T2 - Chimera,基于三大模型混合开发,采用创新AoE架构,推理效率比R1 - 0528快200%,成本大减,在主流测试中性能更好。还介绍了AoE架构构建子模型方法。
诺奖得主实验室走出的中国团队,正用世界模型重构生命分子设计
过去 AI 分子设计多困于‘模态孤岛’,难以跨模态理解和设计。诺奖得主实验室走出的中国团队推出 ODesign 开源项目,将多模态分子纳入统一框架,展现跨模态迁移能力,团队创立英灵殿科技欲重构药物研发流程。
5 分钟搞懂开源大模型选型核心维度,16G显卡也能选对
文章以作者自身经历引入,指出开源大模型选型易陷入‘越大越好’误区。讲透选型4个核心维度,含实操步骤与避坑指南,还介绍选后评估方法,助新手快速锁定适配模型。
数学推理热潮下的冷思考!如何训练真正"全能"的推理模型?
论文评估20余个开源推理模型在多领域表现,发现多数模型数学成功难迁移。揭示微调方法(RL vs SFT)决定能力泛化,SFT像‘填鸭’,RL似‘思维健身’,为构建通用推理智能体提供新路径。
1.9K Star 微软开源TTS王炸!90分钟超长语音合成,4人对话自然切换!
在文本转语音(TTS)领域,生成长篇、多说话人的高质量音频一直是技术挑战。微软最新开源的VibeVoice TTS模型,可一次生成90分钟连续语音,支持4个不同说话人,还具备高效处理长序列等亮点特性。
Yann LeCun放出憋了20年的大招:Meta开源V-JEPA 2世界模型
Meta发布V-JEPA 2世界模型,参数高达10亿,推理速度比英伟达Cosmos快30倍。它基于Vision Transformer架构,是Yann LeCun倡导多年的JEPA路线成果,仅需62小时机器人数据训练就能执行任务,打脸质疑者。
LLM开源2.0大洗牌:60个出局,39个上桌,AI Coding疯魔,TensorFlow已死
9月13日蚂蚁集团开源团队发布LLM开源2.0全景图,收录114个项目,39个新晋、60个出局。生态洗牌,Agent层活跃,分类架构细化。AI Coding等领域发展显著,TensorFlow不敌PyTorch,还梳理厂商大模型发布情况。
万亿思考模型夺下IMO金牌,无缝接入OpenClaw!一句话手搓丐版PS
2026年AI圈竞争激烈,闭源巨头巅峰对决时,开源社区迎来中国队的「技术核爆」。全球首个万亿级混合线性「思考模型」Ring - 2.5 - 1T开源,它能力强大,还能无缝接入Claude Code,实战表现亮眼。
刚刚,美团开源 SOTA 推理模型 LongCat-Flash-Thinking,性能逼近 GPT5-Thinking
美团宣布开源高效推理模型 LongCat-Flash-Thinking,性能逼近 GPT5-Thinking,是国内首个结合多种推理能力的大语言模型。它采用新方法提升性能,已在多平台开源,API 平台免费开放,还兼容主流 API 格式。
英伟达开源9B参数小模型,比Qwen3快6倍
英伟达推出新型小型语言模型Nemotron Nano v2,在复杂推理基准测试上准确率与Qwen3 - 8B相当或更高,速度快6倍。它兼顾推理与非推理任务,支持“思考”预算控制,还开源了创建模型的绝大部分数据。