置信度」共找到 329 篇相关文章

推荐文章7

烧了1万块横测,你用的模型可能掉队了

作者花大成本从后端、人味、前端、推理等维,对glm 5.2、kimi k3等国产模型进行测试,展示各模型在不同测试中的结果,指出国模2T俱乐部的kimi和qwen下限高,且刻板印象需改变。

探索AGI
开源动态8

当 Agent 尝试接管浏览器,连“我是人类”都证明不了?上海交大开源发布交互评测基准 HLL

随着多模态大模型发展,Web Agent 面临验证码挑战。上海交通大学等团队发布 HLL 评测基准,解耦真实为三维,对 8 款前沿模型测试,揭示 Agent 在多步交互微操上的短板。

深度学习自然语言处理
新闻资讯7

Karpathy刚进Anthropic,转头又投了它

AI初创公司Engram成立8个月,估值达6亿美金,获9800万美元融资。它聚焦AI记忆,用Cartridges技术降内存、提速,将推理和记忆层拆开,团队成员背景强大,押注AI范式新转向。

新智元
新闻资讯7

一年一最值得关注的AI榜单来啦!申报即日启动

时值第四届中国AIGC产业峰会,量子位将评选2026年值得关注的AIGC企业和产品。参选有条件,从多维评选,报名4月27日截止,结果5月峰会公布。今年5月还将举办2026中国AIGC产业峰会。

量子位
新闻资讯7

AI 正在毁掉开源:从“协作圣地”到“垃圾洪水”,维护者士气跌至谷底,开始集体掀桌

AI Slop正破坏开源开发中维护者与贡献者的社会契约,贡献数量使系统不堪重负。文章探讨AI Slop时代开源现状、维护者应对方式,还提及基金会政策、极端选项、激励问题,并给出最终建议。

InfoQ
8

谷歌公开全新极限压缩算法:LLM提速8倍、内存占用狂降6倍,精零损失

谷歌推出全新量化算法 TurboQuant,瞄准大模型键值缓存吃内存、高维向量搜索算力瓶颈痛点,能砍内存、提速且精零损失。分 PolarQuant 和 QJL 两步,实验数据表现优异,将改变搜索格局。

AI寒武纪
开源动态7

3.7k星星!爆火开源网站GEO检测工具,老外靠教别人玩这个工具赚麻了

今年315让GEO被更多人关注,虽GEO滥用不行,但正常宣传可用。推荐开源网站GEO审查工具geo - seo - claude,它能多维检测网站,给出审计报告和优化方案,还具备报告生成等能力。

开源AI项目落地
新闻资讯7

一年一最值得关注的AI榜单来啦!申报即日启动

时值第四届中国AIGC产业峰会,量子位将评选2026年值得关注的AIGC企业和产品。参选有条件,从多维评选,4月27日报名截止,结果5月峰会公布。今年5月还将举办2026中国AIGC产业峰会。

量子位
开源动态8

谷歌北大联手学术版Banana爆火,论文图表100%精确生成

谷歌与北大联手推出学术版PaperBanana,能100%精确生成论文图表,美观和逻辑清晰超原版。它由5个智能体分工协作,经实验在各维超越传统基线方法,已在GitHub获上千star。

量子位
算法论文8

142 TFLOPS 的差距:为什么在 Blackwell 上 FP4 MoE 算子工程至关重要

文章对三种主流MoE后端在Blackwell B200 GPU上做基准测试,发现SGLang与vLLM有142 TFLOPS差距,小batch时SGLang快1.84×。差异源于kernel融合、面向Blackwell的CUTLASS schedule及自适应grid sizing等优化。

GiantPandaLLM