基准测试成本」共找到 3368 篇相关文章

开源动态7

国内首套:港中文团队发布7模态人体动作数据集,揭开大模型理解能力短板

港中文邢国良教授团队博士生蒋思阳完成 CUHK-X 多模态人体动作数据集,成果被 ACM MobiSys 2026 接收。用其测试主流大模型,发现理解人类动作平均正确率仅四成。该数据集数据收集方法反常规,还开展了基准测试

DeepTech深科技
产品应用7

Anthropic更新了Skill Creator,评测框架上线

Anthropic更新Skill Creator,上线评测框架。该框架无需写代码,能处理两类技能测试需求,可测试和改进技能,有捕获质量回归等用途。还增加基准模式、多Agent支持等,能让技能触发更可靠,更新已在Claude.ai等可用。

AI工程化
开源动态8

普林斯顿团队领衔发布最强开源数学定理证明模型:32B性能大幅超越前代SOTA DeepSeek 671B

近日,普林斯顿大学牵头多机构推出开源数学定理证明模型 Goedel-Prover-V2。其 32B 旗舰模型在多基准测试超 DeepSeek-Prover-V2-671B,8B 小模型特定基准性能与之持平。该模型有三项关键创新,团队已公开模型及数据集。

机器之心
7

Github持续上榜,这款 AI 自动渗透项目真有点东西!

传统渗透测试依赖人工,效率不高。开源项目PentAGI将‘AI Agent + 渗透测试’结合,能自动完成渗透测试任务,有自主决策能力,功能特性丰富,安装使用较方便,虽有局限但值得尝试。

开源先锋
开源动态8

AutoDev CLI:打造 AI 生成的 AI Agent 质量保障与验证架构

文章介绍AutoDev CLI,它基于AutoDev MPP架构构建,旨在解决上一代AutoDev智能体测试难题。阐述其起步、迭代、演进、集成过程,实现从AI生成代码到验证、生成测试系统的转变,带来可验证、可演化、可移植的优势。

phodal
新闻资讯7

小米的中国芯,与雷军没说的“四个秘密”

本文围绕小米玄戒芯片展开,介绍其推出背景、工艺选择、研发成本及应用前景。指出华为、OPPO调整业务给小米带来契机,3nm工艺因品牌与成本平衡成首选,还分析了自研成本和知识产权等挑战。

芯师爷
新闻资讯7

企业广泛采用 Agentic AI,但领导层理解滞后

Sauce Labs调查显示,97%公司采用或计划采用Agentic AI用于测试,但61%领导层不完全了解软件测试需求。调查揭示矛盾现象,如受访者既看好自主测试又对数据访问不安。还指出团队与高管期望有差异,需解决不一致。

InfoQ
新闻资讯7

明星AI编码助手涨价10倍惹怒开发者!CEO 回应:有人花千元薅了我们10多万,不挣钱不可持续

10月16日,AI代码助手Augment Code更新定价模式,按AI使用量计费,用户称成本涨超10倍。CEO称原模式不可持续,举例有用户带来高额成本。行业内多家公司也调整定价,反映AI编码助手成本和定价难题。

AI前线
算法论文8

算力成本大降!马尔可夫思考机来了,LLM推理成本直接降为线性

用强化学习让LLM具备推理能力耗费颇高,计算量会二次级增长。Mila和微软研究院等团队提出马尔可夫式思考机,重构强化学习形式,让计算量呈线性,实验效果显著,还能与先进模型兼容。

机器之心
开源动态7

Correlations:氛围测试你的向量模型

Jina AI分享内部调试可视化向量小工具Correlations,它能生成交互式热图展示内容间余弦相似度,提供多种交互方式。工具已在GitHub开源,适用于内容去重、验证引文等场景。

Jina AI