「任务成本」共找到 3254 篇相关文章
GPT-5编程测评大反转!表面不及格,实际63.1%的任务没交卷,全算上成绩比Claude高一倍
Scale AI的新软件工程基准SWE - BENCH PRO测试中,‘御三家’表面解决率低。深入看,GPT - 5已提交任务准确率比Claude高一倍。该基准新题多、更复杂,能真实考验模型能力,当前模型解决商业问题能力有限。
Altman承认“搞砸了”!曝 GPT-5.2 牺牲写作换顶级编程,明年成本降 100 倍,实锤Agent 已能永久干活
OpenAI CEO Sam Altman 在研讨会上勾勒 GPT-5 进化蓝图,承认 GPT-5.2 研发“搞砸”写作能力,承诺到 2027 年底其智力成本降 100 倍,还提出未来软件应“随需随生”,重构操作系统。
突袭Cursor,Windsurf抢发自研大模型!性能比肩Claude 3.5、但成本更低,网友好评:响应快、不废话
当地时间5月16日,Windsurf推出首个AI软件工程模型家族SWE - 1。此系列含三款模型,性能比肩Claude 3.5且成本更低。开发者试用评价不错,但也指出存在幻觉问题。Windsurf旨在提升软件开发速度,后续将持续投入。
突破具身智能任务规划边界,刷新具身大脑多榜单SOTA,中兴EmbodiedBrain模型让具身大脑学会「复杂规划」
当前主流大语言模型在具身任务场景面临瓶颈,中兴星云大脑团队推出具身视觉 - 语言基础模型 EmbodiedBrain,构建全流程创新框架,在架构、数据训练、评估体系等方面有突破,还将开源成果推动生态发展。
382人、平均95后,MiniMax百亿估值冲刺IPO!招股书首次披露业绩:研发成本仅为OpenAI的1%、收入猛增8倍
12月21日,通用人工智能公司MiniMax通过港交所上市聆讯。其员工年轻,研发成本仅为OpenAI的1%,收入猛增,产品覆盖多模态。此次聆讯或倒逼行业转向“经营叙事”,加速行业分化。
Anthropic新模型杀疯了!成本直降 2/3、性能直逼GPT-5,用户实测:比“吹”的还强,速度超 Sonnet 3.5 倍
Anthropic发布Claude Haiku 4.5版本,成本降2/3、性能逼近GPT - 5,速度超Sonnet 3.5倍。该模型已全平台上线,可处理大文件,安全对齐性佳。它能与Sonnet协同,适用于企业与软件开发,Anthropic业务也在爆发式增长。
训练效率提升25%、成本降23%!上海期智研究院、算秩未来联合推出MegatronApp:专为万亿参数大模型训练打造的系统工具包
上海期智研究院联合算秩未来在WAIC 2025大会发布开源项目MegatronApp,它是国内首个围绕Megatron - LM的增强工具链。经实际数据,其在该框架下训练效率提25%、成本降23%,含四大模块解决训练难题。
AI产品先发优势在于用户迁移成本高,持续为用户提供价值是保持竞争优势的关键 | 对话AI智能电子衣橱工具搭搭
文章围绕AI智能电子衣橱工具搭搭展开,介绍其功能、开发逻辑与发展规划。搭搭通过AI算法筛选美图定义美,提供穿搭灵感,注重用户需求。团队投入研发,获客成本低,未来聚焦工具,解决穿搭问题,与用户共建产品。
Sora 为什么输给 Codex?
本文探讨Sora输给Codex的原因。奥特曼称因Sora太吃compute,Codex优先级更高。Sora算力连续独占,成本难摊薄;Codex算力碎片可复用,能交错服务多任务,资源回报曲线更好。
皮皮虾也来了!超低成本超高效版OpenClaw
PicoClaw是超轻量级个人AI助手,灵感源于nanobot,用Go语言重构。它成本低、内存占用少、启动快,支持多架构。还介绍了安装、配置、聊天应用等使用方法,及命令行参考和定时任务功能。