结果计价」共找到 527 篇相关文章

新闻资讯7

Anthropic:警惕评测排行榜!差别可能只是机器的内存更大,而已

Anthropic发工程博客指出,AI编程评测排行榜上排名前列的模型分差小,而运行环境硬件配置能让分数波动6个百分点。同一模型在不同沙箱策略下分数不同,资源配置影响评测结果,排行榜分数差距或因硬件。

AGI Hunt
新闻资讯8

震撼!OpenAI神秘模型连破6道前沿难题,奥特曼:AI在造「新知识」

OpenAI首席科学家爆料,其神秘内部模型一周攻克10道未发表顶尖数学难题中的6道。First Proof团队用公开模型测试,结果冷峻。虽OpenAI实际命中率或低于宣称,但AI解前沿题意义重大,也暂无法取代数学家。

新智元
产品应用7

终于敢把真实地址、银行卡、种子词直接扔给大模型了

作者将真实个人信息扔给多个大模型测试,结果模型收到的是脱敏后的占位符,OneAIFW 能自动完成敏感信息的占位和还原,本地完成操作,不留日志不上云,还介绍了使用方法和项目地址。

GitHubStore
开源动态8

WRC整理床铺机器人背后模型曝光!端到端双系统全身智能VLA,仅凭少量微调就能get任务

星海图在2025WRC展示G0模型,可让机器人自主完成铺床任务。其发布端到端双系统全身智能VLA模型G0,结合真机数据集与架构,还构建开放数据集,评测结果优于π0模型,即将开源。

量子位
产品应用7

只提升2个点?我实测Claude 4.1后,发现官方在骗人

官方更新Claude 4.1,作者实测其与Claude4、DeepSeek R1在生成UI设计图、卡片、网页游戏开发等方面的能力。结果显示Claude 4.1进步大,尤其在理解提示词和视觉设计能力上,还能精细修改多文件。

AI产品黄叔
开源动态7

Claude时代终结?LMArena实测DeepSeek R1编程得分超Opus 4,但月暗称其新模型更胜一筹

在闭源模型主导的AI环境下,开源的DeepSeek - R1(0528)在LMArena测试中表现亮眼,编程得分超Claude Opus 4,引发社区关注与讨论。不过LMArena曾被指责偏袒,其联合创始人反驳。此外,月之暗面新模型Kimi - Dev - 72B编程成绩超R1。

AI前线
产品应用7

高考数学全卷重赛!一道题难倒所有大模型,新选手Gemini夺冠,豆包DeepSeek并列第二

因网友质疑上次测评不严谨,此次用六款大模型挑战含解答题的全套高考数学题。结果Gemini 2.5 Pro夺冠,Doubao和DeepSeek R1并列第二。解答题是失分重灾区,图像题难倒多模态大模型。

机器之心
产品应用7

卧底房产AI三天后,我发现地产圈的「信息差」,正被这样一铲到底!

文章测评房产AI工具CRIC深度智联,让其与OpenAI、Google、Anthropic旗下通用AI比拼写地产研报。结果显示,CRIC以独家行业数据库实现降维打击。此外,它还有普通和专业两版,适用不同人群,也指出AI有边界。

AGI Hunt
开源动态7

Stripe 发布基准测试:AI 智能体可开发集成方案,但校验环节存在短板

Stripe推出基准测试套件,评估AI智能体构建完整Stripe集成方案的能力,测试聚焦金融系统贴近生产环境的集成场景。测试显示,不同任务类型评测结果差异显著,核心瓶颈在于验证环节,当前智能体短板在校验逻辑等方面。

InfoQ
新闻资讯8

Claude 通过率不到 4%,SaaS-Bench 撕碎了 Computer-Use 的「全自动办公」幻想

UniPat AI用SaaS - Bench测试,让Agent在真实工作环境中执行任务。结果显示,Claude Opus 4.7端到端完全通过分数仅3.8%,多数模型表现差,还暴露Agent四种致命缺陷,揭示其与真实工作能力有巨大鸿沟。

机器之心