「基准测试成本」共找到 3368 篇相关文章
Opus 5通关ARC-AGI-3!Harness正在变成捆住模型的绳子
ARC Prize官方给Opus 5的ARC - AGI - 3成绩为30.2%,但开发者Jeremy Berman让其借助电脑,正确率飙升至96.2%。还开源代码,换用Codex等测试效果差。表明模型强时,简单环境更佳。
一键部署,100+安全工具,一句话就能打靶!
网络系统复杂,传统渗透测试繁琐低效。开源项目CyberStrikeAI基于Golang开发,集成100+安全工具,通过自然语言对话让安全测试变简单,在GitHub获2.6K+ Star,优势显著。
ECCV 2026 | 智能助手何时该主动开口?Vinci2让第一视角AI助手从「有问必答」走向「主动服务」
现有第一人称视频助手难以自主判断何时介入服务用户。大连理工大学等团队提出Vinci2,含评测基准EgoServe和智能体EgoMemo。它已被ECCV 2026接收,代码和标注均开源。
刚刚,美国AI霸主换了!Anthropic年收300亿,碾压OpenAI
外媒披露Anthropic年化营收达300亿美元,超越OpenAI的240亿。Anthropic由OpenAI前员工创立,15个月营收翻30倍,训练成本仅为对手四分之一。其80%收入来自企业端,而OpenAI陷入‘增收不增利’怪圈,内部也矛盾重重。
Deepseek V4 Pro深夜上线,性能追平Fable 5,但价格只有它的2%
2026年8月12日,DeepSeek V4 Pro正式版上线。它是混合专家模型,规模居世界第一梯队。价格比Claude Fable 5便宜超98%,成本优势明显。其架构节省成本,API开放多模式,产品结构清晰。
具身智能迈入下半场,RoboMemArena全面评测机器人记忆系统
香港科技大学(广州)等多机构打造具身智能评测基准 RoboMemArena,突破传统局限,构建综合评测体系,配套真机测评。它提供多模态标注,任务长程多样,开源资源易用,PrediMem 在其上表现出色。
The Batch: 949 | 人形机器人进入工厂车间
少量人形机器人已进入工业场景,成本接近人力成本。Agility Robotics向Schaeffler提供Digit机器人,负责搬运箱子。目前工业人形机器人应用有限,多处于试点,预计到2040年数量将大增。
Google刚刚开源的一款AI工具,Gemini 2.5驱动浏览器自动化!
Google在GitHub开源AI浏览器自动化工具Computer Use Preview,基于Gemini 2.5模型,用自然语言控制浏览器完成复杂任务。支持双环境,集成Gemini API/Vertex AI,适用于Web测试等,零代码入门。
YC总结的vibecoding核心指南「如何充分利用Vibecoding 」
顶尖孵化器 Y Combinator 总结了 vibecoding 核心指南,涵盖规划流程、版本控制、测试框架等多方面内容,为开发者提供了利用 AI 进行开发的实用策略和方法。
智谱GLM-5强调的Agentic Engineering能力是什么?|甲子光年
智谱上线并开源GLM - 5,在Coding与Agent能力上达开源SOTA,刺激股价上涨。它验证了Agentic Engineering可行性,提升能力阈值,但成本阈值也更显性,未来软件工程或分层发展。