「开源大模型」共找到 10094 篇相关文章
腾讯混元AI开源3D世界生成模型!文图即可生成3D沉浸式场景!
腾讯混元AI实验室开源HunyuanWorld 1.0,这是业界首个支持沉浸式、探索性和交互性3D世界生成的全开源模型。它能通过文图生成3D场景,为多领域提供支撑,还给出安装和代码使用示例。
阿里发布信息检索Agent,可自主上网查资料,GAIA基准超越GPT-4o | 模型&数据开源
阿里发布WebDancer信息检索Agent,能自主上网查资料。它具备多步推理等能力,采用四阶段训练范式,模型和方法已开源。在多个基准测试中表现优异,突显处理复杂任务的鲁棒性和有效性。
单机狂飙4万亿参数,国产AI「四大天王」首次合体!这台超节点鲨疯了
国产「四大开源天王」可在单机运行,背后是「元脑SD200」超节点。它有超大显存、高速互联域和超强算力,支持64路本土GPU且可商用。浪潮信息以开源为战略加速大模型商业化落地。
AAAI 2026 Oral | 拒绝「一刀切」!AdaMCoT:让大模型学会「看题下菜碟」,动态选择最佳思考语言
多语言大模型面临语言选择难题,现有跨语言推理方法存在缺陷。新加坡研究团队推出AdaMCoT框架,通过自适应路由机制动态选语言推理,提升跨语言事实推理准确性与一致性,效果超越传统方法。
音频全能王炸!小米MiMo-Audio开源,力压Gemini/GPT-4o!
小米团队开源通用音频大模型MiMo-Audio,集多种功能于一身,支持7国语言零样本克隆和中英混合合成。首包延迟低,效果自然稳定。在多个基准测试中表现优于Gemini-2.5-Flash和GPT-4o-Audio。
从被吐槽“套壳中国大模型”到自研封神!首次揭秘Cursor背后极速代码Agent如何对标GPT5.1 Codex,生成效率提4倍
10月29日,Cursor 2.0发布Composer大模型,效率约为其他模型四倍。开发者分享其成极速代码Agent方法,如强化学习、平衡训练与推理负载等,还提及未来方向及研发反思。
定位大模型「作弊」神经回路!新研究首次揭示:虚假奖励如何精准激活第18-20层记忆
此前学术界发现大模型用虚假奖励训练也能提升准确率,背后微观机制是黑盒。南科大等团队深度拆解,定位到关键记忆节点,发现‘困惑度悖论’,还能操控记忆,成果对评估、检测和去污染有意义。
硬核拆解大模型,从 DeepSeek-V3 到 Kimi K2 ,一文看懂 LLM 主流架构
本文详细列举 8 个主流大语言模型,硬核拆解架构设计与革新思路,介绍架构演进趋势。如 DeepSeek-V3 的 MLA 与 MoE 技术,OLMo 2 的归一化策略,Gemma 3 的滑动窗口注意力机制等。
新天终启,万象智生!从AlphaGo到GPT-5,新智元十年见证ASI创世纪
2025年9月7日新智元举办十周年峰会,主题为「新天终启,万象智生」,汇聚多位重量级嘉宾探讨AI前沿突破。当下AI发展迅猛,大模型密集发布,如OpenAI的GPT - 5、谷歌的Gemini 2.5等,中国造大模型也在开源领域领先。
ACL 2026 综述:从事后解释到内生解释,大模型内生可解释性的前沿进展
大语言模型强大但解释性成问题,过去多事后解释,现更多研究者转向内生可解释性。ACL 2026 接收的综述论文梳理相关代表方法,总结为五类核心设计范式,指出该方向面临挑战但趋势清晰。