大模型开发」共找到 10003 篇相关文章

开源动态8

清华等发布UltraRAG 2.0,仅用50行代码解锁RAG高性能开发

语言模型存在“知识截止”问题,RAG技术应运而生,成为模型落地主流方案。但随着需求提升,其工程实现变复杂。清华等推出UltraRAG 2.0,仅50行代码实现同等功能,降低开发门槛,性能提升,还能落地多种场景。

AIGC开放社区
算法论文7

Nature重磅研究:模型让你变得更聪明还是更笨了?创造力增强还是扼杀了?

《自然》研究表明,语言模型对创造力的影响取决于任务。简单任务中,它像灵感助推器,分担认知负荷;复杂任务里,易致‘创意固化’,长期依赖还可能使脑‘变懒’。需按需调节使用。

AIGC开放社区
算法论文8

智能体如何学会「想象」?深度解析世界模型嵌入具身系统的三技术范式

长期以来具身智能系统缺预测力,世界模型让智能体有了‘想象’未来的能力。中科等机构团队综述将现有研究划分为模块化、顺序、统一三架构集成范式,并指出未来研究方向。

机器之心
新闻资讯8

连续发布两款万亿参数模型,蚂蚁 AI 来势汹汹

国庆期间模型行业热闹非凡,各团队产品侧重不同。蚂蚁百灵模型团队在十天内连续发布并开源两款万亿参数模型 Ling-1T 和 Ring-1T-preview,引发关注。万亿参数模型难训,国内达到此规模的屈指可数。Ling-1T 综合性能出色,应用场景广泛。蚂蚁选择开源,意在构建开放 AGI 生态。

AI科技评论
开源动态8

小红书发布FireRedChat:首个可私有化部署的全双工模型语音交互系统

小红书智创音频团队推出业内首个支持私有化部署的全双工模型语音交互系统FireRedChat,可将半双工链路升级为全双工,提供级联与半级联服务,在多指标领先,让AI有“人感”。

机器之心
开源动态7

开源DeepSeek R1增强版:推理效率快200%,创新AoE架构

德国TNG公司开源DeepSeek R1增强版DeepSeek - TNG - R1T2 - Chimera,基于三模型混合开发,采用创新AoE架构,推理效率比R1 - 0528快200%,成本减,在主流测试中性能更好。还介绍了AoE架构构建子模型方法。

AIGC开放社区
算法论文8

AAAI 2026 Oral | 拒绝「一刀切」!AdaMCoT:让模型学会「看题下菜碟」,动态选择最佳思考语言

多语言模型面临语言选择难题,现有跨语言推理方法存在缺陷。新加坡研究团队推出AdaMCoT框架,通过自适应路由机制动态选语言推理,提升跨语言事实推理准确性与一致性,效果超越传统方法。

机器之心
产品应用7

从被吐槽“套壳中国模型”到自研封神!首次揭秘Cursor背后极速代码Agent如何对标GPT5.1 Codex,生成效率提4倍

10月29日,Cursor 2.0发布Composer模型,效率约为其他模型四倍。开发者分享其成极速代码Agent方法,如强化学习、平衡训练与推理负载等,还提及未来方向及研发反思。

InfoQ
算法论文8

定位模型「作弊」神经回路!新研究首次揭示:虚假奖励如何精准激活第18-20层记忆

此前学术界发现模型用虚假奖励训练也能提升准确率,背后微观机制是黑盒。南科等团队深度拆解,定位到关键记忆节点,发现‘困惑度悖论’,还能操控记忆,成果对评估、检测和去污染有意义。

量子位
推荐文章8

硬核拆解模型,从 DeepSeek-V3 到 Kimi K2 ,一文看懂 LLM 主流架构

本文详细列举 8 个主流语言模型,硬核拆解架构设计与革新思路,介绍架构演进趋势。如 DeepSeek-V3 的 MLA 与 MoE 技术,OLMo 2 的归一化策略,Gemma 3 的滑动窗口注意力机制等。

机器之心