「推理语言模型」共找到 8238 篇相关文章
AI失忆术!只需3个注意力头,就能让大模型忘记「狗会叫」
Meta和纽约大学团队发布论文《From Concepts to Components》,提出SAMD和SAMI方法。前者定位模型概念注意力模块,后者微调强度。能让模型‘失忆’,还可增强推理、控制安全,为AI研究开新方向。
刚刚,Anthropic新作:大模型意识被发现了
Anthropic 最新研究发现 LLM 有可被语言化报告的全局工作空间(J - space),用 Jacobian Lens 技术能读出模型思考概念、干预推理,还可暴露其未说出口的意图,为 AI 安全审计提供新途径。
性能比肩Gemini 3 Pro!昨晚,阿里千问最强模型来了
1月26日深夜,阿里千问旗舰推理模型Qwen3 - Max - Thinking上线,综合性能对标GPT - 5.2与Gemini 3 Pro。它突破传统推理方式,有自适应工具调用能力,助其在企业级AI竞争中领先。
“边说边思考”,Mini-Omni-Reasoner 开创实时语音推理新范式
Mini - Omni - Reasoner将推理能力引入大型语音模型,开创“边说边思考”范式,实现实时语音推理与交互。推出Spoken - Math - Problems - 3M数据集,经四阶段生成流程构建。训练采用分阶段策略,性能超基础模型。
手机也能跑,腾讯混元一口气开源4款小模型
腾讯混元团队开源4款小模型,最大7B。可在低功耗场景运行,支持微调。是融合推理模型,有快、慢思考模式,在多领域表现出色,亮点是agent和长文能力,已落地多元业务场景。
新鲜出炉!斯坦福2025 CS336课程全公开:从零开始搓大模型
斯坦福大学2025年春季CS336课程“从头开始创造语言模型”课程和材料全公开。介绍了讲师信息,课程目标是引导学生开发语言模型,含5单元19门课,注重实践,还说明了学习该课程需具备的能力。
超越纯视觉模型!不改VLM标准架构,实现像素级深度预测
Meta开源DepthLM,首证视觉语言模型不改架构,也能媲美纯视觉模型的3D理解能力。它通过视觉提示等策略,解锁VLM多任务处理潜力,为自动驾驶等领域带来前景。
AI Coding新王登场!MiniMax M2.1拿下多语言编程SOTA
MiniMax发布旗舰级Coding & Agent模型M2.1,在Multi - SWE - bench榜单中以10B激活参数拿下49.4%成绩,超越竞品成SOTA。它解决模型‘偏科’问题,适配开发工具链,实测在多语言编程任务中表现出色。
Loop-ViT:让AI学会「反复思考」,3.8M参数小模型追平人类平均水平
香港科技大学等团队提出 Loop - ViT,将循环 Transformer 引入视觉推理领域。该模型参数少但性能强,3.8M 小版本追平人类平均水平,揭示视觉推理任务中‘思考时间’比‘模型大小’更重要。
超越纯视觉模型!不改VLM标准架构,实现像素级深度预测
Meta开源DepthLM,首证视觉语言模型不改架构就能媲美纯视觉模型的3D理解能力。通过视觉提示等创新策略,它精准完成像素级深度估计等任务,为多领域带来前景。