差分蒸馏」共找到 1051 篇相关文章

开源动态8

UniPat AI开源SWE-Vision:五百行代码打造SOTA视觉智能体!

多模态大模型代码能力进步大,但基础视觉任务常失误。UniPat AI开源SWE-Vision框架,让模型用Python代码处理视觉判断。它极简设计,在五个视觉基准测试达最优,提升前沿模型视觉表现。

机器之心
产品应用8

智能老师的“成人礼”:一只中国独角兽如何在《时代》岸边重新定义“教育奇点”

2025年《时代》周刊“最佳发明”榜单中,松鼠Ai多模态智适应教育大模型作为教育科技领域唯一中国力量入选。其创始人栗浩洋锚定L5级自主教学目标,成果经多地实践验证,还推动教育公平走向全球,牵头制定AI教育标准。

AI科技评论
推荐文章8

Claude code让程序员消失,Anthropic却说用AI编程会让你变傻

Anthropic科学家实验发现,新手过度依赖AI编程,概念理解、代码阅读和调试能力显著退化,效率未提升。研究识别六种AI使用模式,指出主动思考才是技能形成途径,应保留人脑训练的“摩擦力”。

AIGC开放社区
算法论文7

视觉优势还是语义依赖?揭秘 DeepSeek-OCR 高压缩率背后的真相

中科院等团队论文剖析 DeepSeek - OCR,通过实验揭示其高压缩率下准确率高或依赖语言先验。去掉语言先验,准确率暴跌;下游任务推理崩塌,长文本处理也有瓶颈。

深度学习自然语言处理
新闻资讯7

「国产GPU第一股」首秀!新架构下周揭秘,全栈底座不藏了

2025年12月19 - 20日,摩尔线程首届MUSA开发者大会将在北京举行。届时会揭晓新一代GPU架构与路线图,设20+技术专场,还有1000㎡科技嘉年华,展示全栈能力与生态进展。

新智元
产品应用8

你奶奶也能看懂:DeepSeek-OCR的秘密。

本文介绍DeepSeek-OCR,它并非普通OCR工具,而是用“上下文光学压缩”将大量文本信息转为少量视觉Token。其架构含编码器和解码器,压缩效果惊人,重新定义AI“记忆”,或改变AI认知方式。

AI大模型应用实践
开源动态8

谷歌版小钢炮开源!0.27B大模型,4个注意力头,专为终端而生

谷歌开源Gemma 3 270M,几钟就能完成微调,性能超Qwen 2.5同级模型。此模型小巧高效,可本地运行,还能用它构建OCR应用。它有多项亮点,适合多场景,上手简单。

量子位
新闻资讯7

刚刚,OpenAI内部推理模型斩获IOI 2025金牌!所有AI选手中第一

OpenAI内部推理模型获IOI 2025金牌,总排名第6、AI组第1,沿用IMO金牌版本且未专门训练。商业模型在IOI表现不足,Grok 4相对领先。巨头热衷竞赛,源于竞争、技术迭代及多方利益考量。

新智元
产品应用7

解密 Cursor:一位深度用户的原理探析与实验验证

文章作者作为 Cursor 付费用户,通过实验析其与大模型通信机制和设计原理。用 OpenAI 的`gpt - 4o`模型做实验,发现它是‘基模 + 若干工具’组合,也指出在真实项目因上下文不足表现不佳。

阿里云开发者
算法论文8

长思维链里的推理步骤,哪些最关键?三招锁定LLM的「命门句子」

杜克大学和 Alphabet 研究者提出在句子层面析推理痕迹,找出长思维链中关键步骤,提高 LLM 可解释性等。提出三种互补方法,还提供开源工具,研究为调试推理失败等提供可能。

机器之心