「模型协同进化」共找到 8269 篇相关文章
DeepSeek-V3.2正式版发布,将开源模型的能力推向极致
DeepSeek-V3.2正式版开源,包含标准版和Special版。它采用稀疏注意力机制,降低计算复杂度。后训练阶段有多项算法改进,支撑高难度推理。还融合思考与工具使用,合成训练数据,在智能体评测表现优异。
ACL'25首届博士论文奖 | 重新思考 LLM 中的数据使用
近日,第一届 ACL 计算语言学博士论文奖获得者是 Sewon Min,其论文《重新思考大型语言模型中的数据使用》围绕大型语言模型如何使用训练所用的庞大文本语料库展开研究。
ACL 2026 | 别轻易给AI发「~」,它可能会删掉你的整个主目录
西安交通大学等校团队揭示大模型表情符号语义混淆安全漏洞,用自动化框架测试主流大模型,平均混淆率38.6%,多数混淆响应会“静默失败”,超半数达高危害级别。
模型训练篇|多阶段ToolRL打造更可靠的AI导购助手
当前,AI导购成电商与服务平台新风口,但芝麻租赁场景挑战大,存在需求难匹配等痛点。为此打造AI导购智能体“租赁小不懂”,经架构升级和算法优化,性能提升,还探索了MoE训练和推理优化。
Jina-VLM:可在笔记本上跑的多语言视觉小模型
Jina AI 发布 2.4B 参数量的视觉语言模型 Jina-VLM,在多语言视觉问答任务达 SOTA。它引入注意力池化,连接视觉与语言基座,支持 29 种语言,能高效处理问答等任务,对硬件需求低。
思维链可无限延伸了,MIT等打破大模型上下文天花板
MIT等机构提出新架构Thread Inference Model(TIM),配合专用推理引擎TIMRUN,把推理过程变为树状递归子任务结构并修剪子任务,让模型突破输出窗口限制实现长程推理,实验验证了其性能。
一种基于滑动层合并的高效深度修剪大模型的方法
文章指出深度修剪可加快推理速度,但直接丢层会降低性能。为此提出滑动层合并法,根据相似度阈值融合连续层,简化结构且保持性能。实验显示该方法优于现有技术,还揭示了与宽度修剪结合的潜力。
魔法原子登陆硅谷,行业首个「自进化具身大脑」发布
美西4月28日,国内具身智能企业魔法原子在硅谷主办全球具身智能创新大会。会上发布全域世界模型Magic - Mix、新一代灵巧手H01、旗舰人形机器人MagicBot X1,直面行业痛点,还披露全球化战略目标。
谢尔盖・布林再次进入「创始人模式」?Google押注「AI自我进化」
据路透社报道,Google联合创始人谢尔盖・布林深度介入AI研发,推动递归式自我改进(RSI)方向。此前Google新一代Gemini旗舰模型发布推迟,内部测试显示在关键领域落后对手,此次调整或为提升研发效率。
Lyft 使用 AI 和人机协同扩展了全球范围内的本地化能力
Lyft 实现 AI 驱动的本地化系统,加速应用与网页内容翻译。新系统结合大语言模型、自动评估与人工审核,将翻译周期从数天缩至分钟级,兼顾质量与适配性,还分批量和实时翻译架构处理不同场景。