差分蒸馏」共找到 1051 篇相关文章

新闻资讯7

实测GPT-5:写作坠入谷底,编程一骑绝尘。

文章记录了GPT - 5的发布情况,介绍其系统构成、减少事实幻觉和谄媚行为等改进,也提到跑、性格设置等。实测发现写作和情商不如GPT - 4.5,但编程能力强,还感慨AI发展之快。

数字生命卡兹克
新闻资讯7

刚上市的摩尔线程,即将揭晓新一代GPU架构

2025年12月19 - 20日,摩尔线程首届MUSA开发者大会将在北京举行。大会聚焦国产全功能GPU,主论坛将揭晓新一代GPU架构,还有超20场技术论坛及1000㎡科技嘉年华,诚邀各方共筑智能计算生态。

机器之心
新闻资讯7

估值7.5亿美元初创意欲「撬动」8000亿半导体市场?前谷歌AlphaChip主导者创业研发「AI芯片设计自动化」

由前谷歌研究员创办的 Ricursive Intelligence 公司,尝试开发自动设计芯片的软件。其核心技术将递归智能用于芯片设计,三阶段改进,已获 3500 万美元融资,估值 7.5 亿美元,有望变革半导体行业。

机器之心
新闻资讯8

谷歌Gemini 3.2偷跑上线!2200行代码一镜到底,Claude/GPT坐不住了

发布会未开,谷歌Gemini 3.2 Flash网页端静默上线,编码实力强悍,代码量大幅提升。其核心技术是蒸馏与稀疏化,推理成本大降。Gemini App集成第三方应用,谷歌I/O大会多款产品将曝光,此次发布对谷歌至关重要。

新智元
新闻资讯7

Meta发最强模型打响价格战,小扎对谷歌贴脸开大!北大校友立大功

九月刚过3天就有五个前沿模型发布,Meta发布Muse Spark 1.3踢馆谷歌Gemini 3.8 Flash。它跑提升大、成本低,性价比高,但也遭质疑,大模型下半场或比拼系统架构和智能体工程能力。

新智元
产品应用7

电脑操作、技能、连接器、工作伙伴:豆包的牌来了

最近字节有两个豆包相关新闻,一是在训练超大模型,二是反对模型蒸馏。豆包上线大批 Agent 相关工作任务能力,覆盖办公场景,如电脑操作、技能商店等,过程流畅且可观察,还更新移动端,实现远程控制。

MacTalk
新闻资讯7

Token售卖已无溢价、大模型公司转型“系统商”?记忆张量 CTO 李志宇:智能体能力会拉开距,长期记忆与状态管理成竞争核心

InfoQ 采访记忆张量 CTO 李志宇,他指出 Scaling up 经济效益下降,大模型公司正变系统公司,核心是长期记忆与状态管理能力。2026 年若模型无代际,价格战或加剧。智能体是主赛道,但现有模型推理能力不足。

InfoQ
推荐文章7

为 120 个 AI 项目做增长,矩阵魔方叶晨曦:优秀的增长团队,不能去「爱」自己的产品

叶晨曦带着近10亿营销经验回归AI赛道,享AI GTM底层逻辑。他指出AI营销缺人,窗口期仅三个月;还谈到找异化、破圈、营销预算等要点,强调创始人要身先士卒,职业创业者应“失去爱产品的能力”。

Founder Park
算法论文8

SentGraph:一句一句把多跳RAG“画”成图

传统RAG在多跳场景易‘断链’,因检索单元太胖、逻辑关系乱。SentGraph把检索单元缩到句,按逻辑画三层图。线下建图拆句、找关系、架桥梁;线上推理有Anchor初选、精炼及路径扩展。实验提升显著,也有局限。

PaperAgent
算法论文8

5秒完成3D场景编辑,北大&港中文&上海AI Lab搞出VGGT-Edit,120倍加速太炸了

北大、港中文等团队提出原生3D编辑框架VGGT-Edit,不再绕回2D,直接在3D空间编辑。它采用残场预测等机制,在DeltaScene测试集表现出色,单次编辑约5秒,最高120倍加速。

量子位