泛化推理能力」共找到 4696 篇相关文章

算法论文7

拆解大模型几项核心操作背后的数学与 Infra 优化逻辑

文章拆解大模型核心操作(RMSNorm、Softmax、Causal Mask、Sampling)背后的数学与Infra优化逻辑。指出Infra优化是用数学等价变换或精度妥协换硬件利用率和推理速度,还介绍各操作原理、问题及优化方法。

腾讯技术工程
开源动态8

Qwen-Scope:看穿大模型的“小心思”

Qwen-Scope是基于Qwen3和Qwen3.5系列模型训练的可解释性模块,通过在隐藏层插入SAE提取可解释特征。它能分析模型行为、优化模型,应用于推理、数据、训练、评估等场景,可前往Huggingface或魔搭体验。

千问大模型
开源动态8

阿里开源 Qwen3-TTS 全家桶!语音设计、克隆、生成全打包,开源 2 天 3K Star!

阿里通义团队开源 Qwen3 - TTS 全家桶,含语音设计、克隆、生成功能,开源 2 天获 3K + Star。它有秒级克隆、语音设计等能力,有 0.6B 和 1.7B 两种规格,双轨架构等技术创新保障性能。

开源星探
新闻资讯7

AI 太烧钱!微软选择「倒戈」DeepSeek

微软宣布Copilot Cowork全球上线并引入按使用量计费机制,还评估引入DeepSeek V4。Agent普及使AI成本问题凸显,微软进行系统性重构,构建质量保障体系,成本工程化能力成竞争新焦点。

AI科技评论
开源动态8

为训推加速!全新FlashQLA注意力算子库开源

自Qwen3-Next发布,GDN成Qwen主力注意力层,随模型规模扩大开销增大。现开源FlashQLA算子库,融合优化GDN Chunked Prefill前反向算子,在NVIDIA Hopper上多场景加速,提升预训练和端侧推理效率。

千问大模型
新闻资讯7

图灵也没想到,智能,必须在现实中「活」下来

第六届 ATEC 科技精英赛 ATEC2026 已开赛,由多单位共同组织。赛事聚焦人工智能、具身智能等方向,以真实世界挑战为命题,通过赛题设计检验系统在真实环境的运行能力,还设置丰厚奖励。

机器之心
算法论文8

谷歌最新发表的Science论文,颠覆了人类对ASI的想象

谷歌等机构研究者在《科学》发文,提出真正智能爆炸已发生,是多元、社会性且与人类深度缠绕。推理模型内部涌现‘思想社会’,当下人机协作进入‘半人马时代’,还探讨了AI扩展、对齐及治理问题。

新智元
算法论文8

罕见!Meta、OpenAI、xAI联合分享了用生产环境提升LLM的最佳实践!

Meta、OpenAI、xAI联合发表成果CharacterFlywheel,聚焦在生产环境提升社交型AI对话能力。团队基于LLaMA 3.1迭代15个版本,7/8的A/B测试显示正向提升,介绍了架构、数据管道、奖励模型等内容。

PaperAgent
新闻资讯8

2026 编程巨变:Anthropic 报告揭示 Agent 编程八大趋势

Anthropic发布《2026 Agent编程趋势报告》,预测写代码将从‘人写’变为‘人指挥AI Agent写’。报告梳理八大趋势,分基础、能力、影响三类,还给出2026年需关注的领域,指出AI改变开发者工作内容。

宝玉AI
开源动态8

美团智能体SOTA模型LongCat-Flash-Thinking-2601开源

美团龙猫团队开源智能体推理模型LongCat - Flash - Thinking - 2601,总参数5600亿。该模型在多方面有卓越表现,团队通过构建数据、模拟环境、采用强化学习策略及设计高效架构等,使其比肩闭源模型。

AIGC开放社区