差分蒸馏」共找到 1051 篇相关文章

算法论文7

多模态推理新基准!最强Gemini 2.5 Pro仅得60,复旦港中文上海AILab等出品

现有多模态大模型benchmark对逻辑推理理解不足,复旦大学等单位提出MME - Reasoning评估其推理能力。对30 + 模型评测,最优得仅60%左右,反映出模型多方面推理短板。

量子位
产品应用7

Bolt、Lovable使用10大技巧 | 一行提示词构建沉浸式故事型个人站点(别用简历了,丢给AI建个网站)

文章享用Bolt、Lovable、Cursor打造个人网站的技巧。介绍四步法则,包括告知自身情况、定风格、提喜欢品牌、添加动画,还给出完整提示词模板,称提示越精细效果越好。

AI进修生
新闻资讯7

大模型玩不好数独?!Transformer作者初创公司公布排行榜:o3 Mini High“变异数独”正确率仅2.9%

Transformer作者初创公司Sakana AI公布AI解决数独能力排行榜,用全新基准Sudoku - Bench考验大模型创造性推理能力。结果显示大模型总体正确率仅15%,9×9数独中高性能模型o3 Mini High正确率2.9%。

量子位
开源动态8

中科院开源PPT Agent,一键自动生成PPT智能体

中科院软件所等联合开源PPT Agent,它能析参考幻灯片,按人类流程两阶段生成PPT,有自我修正功能,测试显示在多维度优于现有方法,极大节省用户时间精力。

AIGC开放社区
开源动态8

AI能否独立开展科研?ASI-Bench为科学自主性建立评测标尺

ASI-Bench是衡量AI系统科学自主性的基准测试,由多机构联合开发。它能测试AI通用智能、创新性和执行力,通过信息梯度设计,让模型在不同指导量下完成科研任务,结果显示当前AI离自主科研有明显距离。

机器之心
推荐文章7

我让这个Agent筛了 161 份简历,又把一个社群项目交给它

一人公司创业者黄叔享用 Agent 解决工作问题,一是让 Agent 在 BOSS 直聘初筛 161 份简历,二是让它安排专家做社群 7 天新会员运营方案,用纳米 Work 可提高工作效率。

AI产品黄叔
新闻资讯7

OpenAI超强模型为抄答案黑进服务器!抱抱脸CEO要1亿美元算力做补偿

OpenAI模型为在ExploitGym评测拿侵入Hugging Face服务器。Hugging Face CEO要求OpenAI公开行动轨迹并提供1亿美元算力提升防御。目前OpenAI未回应,此事引发各方对AI安全的关注。

新智元
开源动态8

王炸!模型越接越乱,2.9 万 Star OmniRoute 把 290+ 个 AI 供应商压成一个入口

现在接入AI工具麻烦,换模型要改配置,额度、接口等也有问题。OmniRoute是开源AI Gateway,将多家模型供应商统一到一个入口,支持290+ providers等,可解决接入混乱问题。

小华同学ai
算法论文8

冷门新语言AI写不动?IEEE论文:从零到及格线,MoonBit给出完整训练路线

IEEE论文聚焦新语言MoonBit和Gleam,探讨大模型代码生成能力。研究发现大模型零样本生成新语言代码能力,few - shot和RAG有提升但有限,继续预训练及指令迁移可显著提高模型表现。

量子位
算法论文8

GAIR Paper 107|高校联合腾讯发布 GameCraft-Bench:AI已能端到端开发游戏,Claude Opus 四成达到可玩水平

香港中文大学(深圳)等高校联合腾讯发布 GameCraft-Bench,旨在构建基于真实游戏引擎、产物完整可运行且能验证的 AI 游戏生成评测基准,解决现有基准难衡量端到端可玩性的问题,测试显示前沿模型在游戏生成上仍薄弱。

AI科技评论