大模型评估」共找到 9355 篇相关文章

算法论文8

推理效率狂飙60倍:DiDi-Instruct让扩散模型16步超越千步GPT

普渡学等研究者提出 DiDi-Instruct 后训练方法,可将扩散语言模型推理加速 60 倍,超越传统 GPT 模型。该方法实现推理效率与效果双提升,为语言模型落地提供新方案。

机器之心
开源动态8

Qwen-Scope:看穿模型的“小心思”

Qwen-Scope是基于Qwen3和Qwen3.5系列模型训练的可解释性模块,通过在隐藏层插入SAE提取可解释特征。它能分析模型行为、优化模型,应用于推理、数据、训练、评估等场景,可前往Huggingface或魔搭体验。

千问大模型
新闻资讯7

模型能复刻这些系统吗?ProgramBench给出了残酷答案

斯坦福NLP组发布ProgramBench,用200个完整代码库重建任务测试主流模型,要求模型仅根据可执行文件还原如SQLite等项目完整代码,结果所有模型实际解决率为0%,说明模型更擅模仿代码表面结构。

AI工程化
开源动态7

国产开源模型:再见9月,你好10月~

9月国产模型持续开源,涉及DeepSeek、Qwen、百度等。如DeepSeek-V3.1缓解语言问题、优化Agent能力;阿里Qwen系列开源超10个模型;百度Qianfan-VL增强领域能力等。还展望10月新模型开源。

PaperAgent
新闻资讯8

杨植麟当主持人的模型圆桌:张鹏罗福莉夏立雪都放开说了

中关村论坛上,杨植麟、罗福莉、张鹏、夏立雪、黄超齐聚,共论agent的下一代演进。各位咖观点硬核,如罗福莉认为中国模型团队优势在‘算力受限下的最优解能力’,张鹏解释智谱新模型涨价原因等。

量子位
新闻资讯7

神秘模型「Pony Alpha」引外网热议,它会是国产模型中的谁?

近日,全球模型服务平台OpenRouter上搜索第一的神秘模型「Pony Alpha」引外网热议,它是新一代通用模型,在多方面表现突出且可免费使用。网友、AI猜测其身份众说纷纭,已有人用它做出惊艳案例。

机器之心
新闻资讯7

小米小爱同学:资源受限下,实现端侧模型的高性能推理

InfoQ对话小米小爱同学端侧AI负责人杨永杰,探讨模型端侧部署难题。团队自研推理框架,实现180 tokens/s推理速度,采用共享基座架构支持多业务。未来端侧模型突破依赖硬件提升与架构演进。

AI前线
推荐文章8

她如何把“系统2”带给了模型 |对话微软亚洲研究院张丽

本文是量子位对微软亚洲研究院首席研究员张丽的访谈。张丽团队在2023年开始探索模型深度推理能力,2025年1月发布rStar - Math,用蒙特卡洛搜索算法让7B模型实现o1级数学推理能力,引发广泛讨论。

量子位
开源动态8

Day0迁移、一键部署,华为开源的昇思MindSpore成为模型开发的“万能钥匙”

模型无法一统天下的背景下,开发者面临在一个框架、生态体验众多主流模型和AI技术的难题。华为开源的昇思MindSpore可实现训练Day0迁移、推理一键部署,还介绍了其相关技术和实测效果。

量子位
新闻资讯7

小米小爱同学:资源受限下,实现端侧模型的高性能推理

InfoQ对话小米小爱同学端侧AI负责人杨永杰,了解其团队在资源受限的端侧设备实现模型高性能推理的策略。目前端侧模型商业化落地慢,团队提前布局,自研框架,实现超180 tokens/s推理速度,还分享未来突破方向。

InfoQ