成本性能」共找到 6938 篇相关文章

算法论文8

ICML 2025 | 大模型在信息不完备的情况下问出正确的问题吗?

当前大语言模型推理研究多聚焦被动推理,主动推理研究少,制约其在现实场景应用。为此提出 AR - Bench 基准评估大模型主动推理力,实验显示大模型主动推理力严重不足,并指出后续拓展方向。

机器之心
开源动态8

阿里智体多轮推理超越GPT-4o,开源模型也做Deep Research

通义实验室推出自主信息检索智体WebDancer,其通过系统化训练范式为构建智体提供路径,也为在开源模型上复现Deep Research系统提供指导。它在多数据集测试中表现出色,团队还对其未来应用做了展望。

量子位
产品应用7

用DeepSeek徒手造一个对话的AI简历,助你当场拿下Offer。

作者招人时收到很多AI生简历,有份把自己变含AI对话的可视化简历脱颖而出。作者分享用Dify+Gemini或DeepSeek+YouWare搭AI简历方法,还以马斯克求职为例演示操作步骤。

数字生命卡兹克
新闻资讯7

两岁的Llama,最初的14位作者已跑了11个!Mistral最大赢家

Meta 开源 Llama 模型改变大模型格局,但短短两年,14 位初创作者 11 人离职。Mistral 受益最大,由两位核心架构师创立,其模型与 Meta 竞争。Meta 面临留才挑战,领先优势消退。

机器之心
开源动态8

靠"氛围编程"狂揽 2 亿美金,Supabase AI 时代最性感的开源数据库

本周,开源数据库 Supabase 宣布完 2 亿美元 D 轮融资,投后估值 20 亿美元。它以“开箱即用”体验降低 SQL 接入门槛,适配“氛围编程”工作流,还不断集 AI 力,开源模式也很有吸引力。

AI前线
算法论文8

颜水领衔,给AI分段位!超100款多模态模型,无人达到L5

十所顶尖高校联合发布General - Level评估框架和General - Bench基准数据集,用五级分类制明确多模态通才模型力标准。评估超100款模型,发现多数在L2 - L3,无L5模型,揭示当前模型不足。

新智元
开源动态8

Qwen3技术报告首次全公开!“混合推理模型”是这样炼

本文首次公开Qwen3技术报告,介绍其模型架构、预训练及后训练过程、性表现等技术细节。Qwen3整合两种模式,引入思考预算机制,降低轻量级模型计算资源,在多基准测试领先,多语言支持扩展至119种,所有模型开源。

通义千问Qwen
新闻资讯7

都标5美元,账单差三!OpenAI高管:token从来没法直接比价

OpenAI Codex负责人Tibo指出,不同模型对同一段文字切分的token数不同,即便单token价格相同,最终账单也可差异很大。他还提到,token无统一计量标准,跨厂商和新旧模型计数都难通用,真正重要的是每次功结果的本。

新智元
7

Palantir活了所有FDE羡慕的模样:被骂十年外包,股价一天暴涨29%

8月3日美股盘后,Palantir交出2026年二季报,业绩亮眼致次日股价涨29.45%。此前它被看空,因其交付方式被指像外包。但从财务看它利润率高,且业务增速快,不过高估值和国际业务仍存挑战。

DeepTech深科技
算法论文8

不换模型,效果提升104%!上海AI Lab让Harness也自进化了

上海人工智实验室团队提出的Self-Harness引发关注,它针对Agent外层Harness改进。实验显示,在Terminal-Bench-2.0上,不换模型只改Harness,Qwen3.5-35B-A3B等模型效果显著提升。

量子位