「大记忆模型」共找到 9531 篇相关文章
CVPR 2026 | 20步也能稳住画质,这个扩散加速方法不一样
扩散模型推理效率是落地应用的核心制约因素,阿里安全 AGI 实验室 - 御风大模型团队联合浙江大学提出全新扩散加速方法 TC - Padé,在低步数设置下能兼顾生成质量与推理效率,已被 CVPR 2026 录用。
DeepSeekV3.2技术报告还是老外看得细
ChatGPT三岁生日时,DeepSeek两款开源模型DeepSeek-V3.2和DeepSeek-V3.2-Speciale引发热议。它们在智能体评测中表现出色,缩小了开源与闭源模型差距,还降低了成本,给硅谷闭源AI公司带来压力。
ICCV 2025 | EPD-Solver:西湖大学发布并行加速扩散采样算法
扩散模型成生成任务主流技术,但逐步去噪机制致推理延迟大。西湖大学提出 EPD - Solver 算法,融合三类加速思路优势,可减少积分误差、提升生成质量,还能作插件集成,突破扩散模型速度与质量权衡瓶颈。
数据合成篇|多轮ToolUse数据合成打造更可靠的AI导购助手
文章以租赁导购助理“小不懂”为例,介绍Tool Use训练数据合成方案。先分析训练数据的目标与难点,提出动态多智能体对话生成框架,阐述多轮数据、复杂问题合成及过滤方案,展示数据和模型效果,还提及未来工作方向。
实证:现在的LLM根本不会Reasoning!
论文指出当前大推理模型(LRM)如DeepSeek - R1等可能只是在表演“思考秀”,遇到复杂问题就崩溃。研究者用4个可控谜题测试,有三大颠覆发现,还揭示思考过程的荒诞现象,直指行业痛点并给出发展方向。
阿里 Qwen3:持续开源,SOTA 连连!
很多从业者有‘闭源模型一定比开源强’的刻板印象,而 Qwen 正打破此认知。最近阿里连发三款模型 Qwen3-235B、Qwen3-Coder、Qwen3-235B(Thinking),在多方向发力且拿下多个开源榜单第一。
The Batch: 948 | GLM 5.1:面向长时任务的能力提升
Z.ai将旗舰开源权重大语言模型升级为GLM - 5.1,可在单个任务自主运行八小时。它专为编程和智能体任务设计,有推理等特性,在多榜单表现佳,但推理和数学能力落后闭源模型,价格有提升。
百度Qianfan-VL开源,纯国产自研昆仑芯跑出世界一流
百度开源全新视觉理解模型Qianfan-VL,有3B、8B和70B三个版本,在昆仑芯P800芯片上训练。该模型多模态能力强,OCR和教育场景表现突出,跑分超国际主流模型。芯片功耗低、架构优,模型训练方法创新。
最强开源Agent!Kimi K2接入Claude Code,爽翻~【喂饭级教程+实测】
上周五Kimi开源最新旗舰模型K2,它是1000B参数MoE大模型,专为Agent场景优化,API已上线且兼容多API。文章给出Kimi - K2接入Claude Code的喂饭级教程及实测,实测显示组合表现有亮点也有不足。
腾讯混元最新开源成“最强翻译”:国际机器翻译比赛获30个语种第一
腾讯混元团队的Hunyuan-MT-7B以7B总参数量获国际翻译比赛冠军,还开源了该模型及翻译集成模型Hunyuan-MT-Chimera-7B。其Shy框架有三大创新,在多方面表现优异,还为垂直领域优化提供模板。