结果定价」共找到 634 篇相关文章

开源动态7

走出 MMLU 的高分幻觉:AI Agent 的「斯坦利时刻」与职场生存法则

文章指出多模态大模型在基准测试分数高,在实际业务流程却像‘职场巨婴’。研究团队构建Trainee - Bench测试顶尖模型,结果显示模型离‘独立上岗’远,凸显提升Agent自主学习性的重要性。

AI科技评论
新闻资讯7

一年一度最值得关注的AI榜单来啦!申报即日启动

时值第四届中国AIGC产业峰会,量子位将评选2026年度值得关注的AIGC企业和产品,结合调研与专家意见,结果5月峰会公布。企业和产品有参选条件与评选维度,报名4月27日截止。

量子位
算法论文8

警惕!大模型成本倒挂:你正在为模型的多余「思考」买单

一项来自多所高校和微软研究院的研究揭示AI模型价格倒挂现象,低定价模型可能产生更高实际开销。研究聚焦8个前沿推理模型和9个主流数据集,指出推理token是成本倒挂主因,且实际开销难以预测。

机器之心
开源动态7

记录下SGLang 开发,编译和Profile的几个小技巧

作者记录在SGLang开源一年学到的开发和Profile技巧。包括解决perfetto可视化PyTorch Profiler结果时kernel丢失问题、PR切换分支方法,还介绍让SGLang无视版本运行以定位bug的方法。

GiantPandaLLM
新闻资讯8

重磅!Anthropic内部神秘模型在黎曼猜想上取得突破:关键下界从41.6%推到67.2%

A厂宣布Claude在黎曼猜想相关问题取得进展,其内部研究版Claude将黎曼ζ函数零点满足猜想比例的已知下界从41.6%提升到67.2%,经数学家验证,结果意外且有新方法。

AI寒武纪
产品应用8

Claude Managed Agents 公测发布!Agent 开发成本直降 500 倍

Claude 宣布 Managed Agents 进入公测,可大幅降低 Agent 开发成本。它能自动生成配置和代码,接管多项任务,实现长时间自主运行。多家早期客户使用后效果显著,还介绍了定价、接入方式及与自建的差异。

AGI Hunt
新闻资讯7

用AI写代码效率反降19%!246项任务实测,16位资深程序员参与

研究者让16位经验丰富开发人员完成246项开源代码任务,随机分配是否用AI。结果显示,用AI时完成任务平均时间增加19%,与开发者预测的效率提升24%相反。

量子位
新闻资讯7

一年一度最值得关注的AI榜单来啦!申报即日启动

时值第四届中国AIGC产业峰会,量子位将评选2026年度值得关注的AIGC企业和产品。参选有条件,从多维度评选,报名4月27日截止,结果5月峰会公布。今年5月还将举办2026中国AIGC产业峰会。

量子位
新闻资讯7

一年一度最值得关注的AI榜单来啦!申报即日启动

时值第四届中国AIGC产业峰会,量子位将评选2026年度值得关注的AIGC企业和产品。参选有条件,从多维度评选,4月27日报名截止,结果5月峰会公布。今年5月还将举办2026中国AIGC产业峰会。

量子位
推荐文章8

Agent项目最头疼的不是技术,这可能是近期最棒的Agent调研。

MMC深入访谈多家AI Agent创业公司创始人和企业用户,撰写《State of Agentic AI: Founder’s edition》。调研显示创始人头疼的多是非技术问题,还分析了准确率与主动性、定价策略等情况。

探索AGI