计算范式转移」共找到 1682 篇相关文章

算法论文8

DPad: 扩散大语言模型的中庸之道,杜克大学陈怡然团队免训推理加速61倍

扩散大语言模型(dLLMs)有全局规划能力,但存在计算冗余。杜克大学陈怡然团队揭示其“草稿纸机制”,提出免训练方法DPad,结合现有技术,能在几乎无损精度下实现高达61.4倍推理加速。

机器之心
推荐文章8

Claude Code之父最新访谈揭秘:Claude Code 迭代靠的是直觉「附个人独家使用秘笈」

Claude Code项目负责人Boris Cherny在访谈中揭秘其迭代靠‘直觉系统’,探讨智能体编程实用化、模型演进等。他还谈及软件工程师未来工作转变,给出使用Claude Code秘笈,强调基础与创造力重要性。

AI寒武纪
算法论文8

语音分离最全综述来了!清华等团队深度分析200+文章,系统解析「鸡尾酒会问题」研究

清华等多校及字节跳动研究者全面调研语音分离领域,撰写综述论文,分析200余篇代表性论文。从问题定义、学习范式、模型架构等多维度展开,还探讨评估指标、数据集等,指出未来挑战与探索方向。

机器之心
推荐文章8

一文读懂 RAG 与 KAG:原理、工程落地与开源实战(含代码与链接)

文章介绍RAG与KAG,RAG从文档找证据回答,适合开放域、时效更新快场景;KAG将结构化知识融进生成过程,实体关系与事实一致性更稳。还给出实战建议、工作流要点、最小可跑示例、开源组件及项目等。

机器学习AI算法工程
推荐文章8

对话RoboScience邵林:VLOA大模型如何突破具身智能泛化瓶颈

本文对话RoboScience联合创始人邵林,探讨VLOA大模型突破具身智能泛化瓶颈。他介绍了模型优势、设计思路,对比VLA,还谈及范式、难点及落地场景等,强调以人中心、做有温度技术,重视模型落地。

甲子光年
推荐文章7

当代码遇上大模型:智能编程助手的架构设计与工程实践

在 InfoQ 举办的 QCon 全球软件开发大会上,字节跳动段潇涵介绍如何基于大语言模型构建智能编程助手。他分享实践经验,剖析研发痛点,介绍技术架构,还探讨未来发展方向,如认知增强、工具整合等。

InfoQ
开源动态8

轻量级易开发,8B参数释放大实力!科学多模态模型Intern-S1-mini开源

上海人工智能实验室继7月26日开源后,推出轻量化版本Intern-S1-mini。它是8B参数“迷你模型”,兼具通用与专业科学能力,适合快速部署和二次开发,在多方面表现出色,还降低了对高端计算设备依赖。

OpenMMLab
推荐文章8

迈向可信AI:LLM幻觉的分析与优化

随着LLM广泛应用,其幻觉现象成AI落地关键挑战。文章分析LLM幻觉成因、优缺点,结合RAG、SFT、强化学习等技术,提出多维度优化方案,为构建可信大模型应用提供理论与实践路径。

腾讯技术工程
算法论文8

DeepSeek-GRPO重要性权重设计错误?详解Qwen3新强化学习算法GSPO

论文指出GRPO在大语言模型训练中不稳定,因其重要性权重设计错误易引入高方差噪声。为此提出GSPO算法,从序列维度计算梯度,解决了MoE模型RL训练的稳定性问题,在Qwen3上效率更高。

深度学习自然语言处理
推荐文章7

一起聊聊Nvidia Blackwell新特性之低比特GEMM

本文是NVIDIA Blackwell架构GEMM研究系列文章第三部分,介绍低精度计算,探讨Blackwell GEMM如何执行,关注6位和4位格式及对内存布局影响。还提及低精度优势、数据格式、UMMA实现、操作限制、CUTLASS抽象方式等。

GiantPandaLLM