「Booster K1」共找到 2250 篇相关文章
代码榜刷满分,AI科研却撞墙?140道真实研究题撕开「自进化」真相
新工作MLS - Bench覆盖12领域、140个研究任务,评测前沿模型科研能力。虽模型工程执行强,但科学发现能力弱,当前仍难提出有效算法创新。其评测已纳入Kimi K3和Qwen3.8 - Max官方发版表。
Meta重返开源!30B本地Agent塞进24GB显存,LeCun火速力挺
Meta重返开源,推出开源模型Muse Glimmer,参数30B,经量化后一块24GB消费级显卡就能跑通,拥有完整Agent能力。Meta还预告Muse Spark 1.2开放权重版本将发布,扎克伯格称会恢复发布部分开放模型。
烧了1万块横测,你用的模型可能掉队了
作者花大成本从后端、人味、前端、推理等维度,对glm 5.2、kimi k3等国产模型进行测试,展示各模型在不同测试中的结果,指出国模2T俱乐部的kimi和qwen下限高,且刻板印象需改变。
吴恩达来信:开放模型,开放执行框架,开放安全
吴恩达团队用闭源模型做安全审查遇阻,后改用 OpenWorker 框架结合开源权重模型 Kimi K3 和 GLM 5.2 取得进展。他认为开放模型和执行框架能带来更安全系统,开源权重模型舆论战虽胜,但立法层面未胜。
Claude Opus 5被扒光了!1511行提示词底牌全摊开
Anthropic的Claude Opus 5上线当天,系统提示词被开发者Eversmile1传到GitHub。提示词含产品说明、法务合规手册、推销渠道内容。其记忆规则严格,版权引用限制多,商业推荐有不同策略。上线24小时能力被广泛测试。
姚顺雨Agent能力交卷!腾讯混元Hy3把元宝练成了打工人
腾讯混元Hy3正式版发布,总参数295B、激活参数21B,最大支持256K上下文。它是快慢思考融合的MoE模型,重点提升Coding和Agent能力。其加持下,元宝大升级,能完成办公、生活等多场景任务。
将DSA注意力引入多模态,快手Keye2.0开启强化推理新范式
快手发布新版多模态大模型Keye-VL-2.0-30B-A3B,率先将DSA机制引入多模态理解场景,解锁256K超长上下文深度感知,还首次解锁Agent协作机制。该模型在多方面表现出色,且将融入业务带来收益。
ICLR 2026 Oral|大模型总爱「想太多」? DECS从源头消除冗余思考,实现推理token减半且性能不降反升
以DeepSeek - R1等为代表的大型推理模型存在过度思考问题,造成大量冗余计算。复旦大学等团队在ICLR 2026 Oral论文中揭示‘长度惩罚’局限性,提出DECS框架,在多基准测试中实现推理长度减半且性能提升。
AI公司最赚钱的生意,还是卖广告
2026年Q1财报显示,AI浪潮下广告仍是最赚钱业务。Meta的AI广告工具年化营收超600亿美元,超过OpenAI和Anthropic收入之和。广告变现路径短,AI放大其效率,OpenAI也开始测试广告。
谷歌掀桌:深度研究智能体进入自动驾驶时代
4月末谷歌DeepMind推出两款基于Gemini 3.1 Pro的AI研究智能体,标准版重速度,增强版求详尽。Max版在多测试获SOTA得分,能自主研究课题出报告,还可融合数据、生成图表,已开启公开预览。