测试平台」共找到 2955 篇相关文章

产品应用7

面向业务落地的AI产品评测体系设计与平台实现

文章聚焦淘宝闪购技术部AI产品评测,先介绍AI业务应用场景与评测挑战,接着阐述评测体系从多方面思考的要点,包括评价维度、评测方式等,还提及平台建设成果,最后展望未来多模态评测等规划。

阿里云开发者
算法论文7

CodeClash 通过多轮编程竞赛对大型语言模型进行基准测试

为评估大型语言模型(LLM)编码能力,斯坦福、普林斯顿和康奈尔研究人员开发 CodeClash 基准测试,让多个 LLM 在多轮比赛中较量,涉及多种代码竞技场,还评估模型分析代码库能力,未来将处理更大代码库。

InfoQ
新闻资讯8

刚刚,AI科学家Zochi在ACL「博士毕业」,Beta测试今日上线

Intology宣布AI科学家Zochi论文被顶会ACL主会录用,成首个独立通过A*级别会议同行评审的AI系统,还开放Beta测试。其研究成果显示语言模型安全措施或有不足,Zochi工作成果多且质量高。

机器之心
开源动态8

顶尖AI竟输给三岁宝宝,BabyVision测试暴露多模态模型硬伤

UniPat AI 等发布多模态理解评测集 BabyVision,测试显示多模态大模型纯视觉能力仅达三岁幼儿水平。其通过对比实验、细分任务评测,揭示模型系统性缺基础视觉能力,还给出新方向及发展建议。

AINLPer
开源动态7

FACTS 基准测试套件问世,用于评估大型语言模型的事实准确性

FACTS 基准测试套件由 FACTS 团队与 Kaggle 联合开发,基于原 FACTS Grounding Benchmark 增加三个新基准,可从四个维度评估大模型事实性。初步结果显示进展与挑战并存,多模态成难题。

InfoQ
新闻资讯7

丛乐创办Acelegen:用基因编辑让活细胞成为可编程计算平台

过去五年AI重塑生物技术。CRISPR基因编辑技术开发者丛乐联合创立Acelegen,集成过往成果,欲把活细胞变成可编程计算平台,其愿景是找到“生命的Scaling Law”,独特性显著但答案待揭晓。

DeepTech深科技
推荐文章8

ACP 协议 + 多 AI 编程智能体:企业研发的新生产力平台

文章围绕 ACP 协议展开,介绍其概念、工作原理及在 AutoDev 的集成实践。还提及 ACP 生态、多 Agent 协作实践,如 Augment Intent、Google Antigravity。最后阐述企业级 AI 平台治理体系,包括 MCP、ACP、A2A 三层协议协同价值。

phodal
产品应用8

英伟达发布物理AI和机器人顶级开发平台Nvidia Jetson Thor

英伟达官网发布专为物理AI和类人机器人打造的顶级平台Nvidia Jetson Thor。其AI计算能力强劲,相比NVIDIA AGX Orin性能和能效大幅提升,硬件配置、存储、多媒体处理及相机支持等方面表现出色,能应对复杂场景。

AIGC开放社区
算法论文8

Anthropic、Thinking Machines Lab论文曝光:30万次压力测试揭示AI规范缺陷

Anthropic和Thinking Machines Lab等机构研究人员提出模型规范压力测试法,基于细粒度价值体系生成超30万个查询场景,分析12个前沿大模型回答,揭示模型规范存在原则冲突、解释歧义等缺陷。

机器之心
新闻资讯8

DeepSeek低价风暴打服硅谷!海外平台争相倒贴V4 Flash

DeepSeek V4 Flash掀起价格风暴,全球开发者为之疯狂。海外平台如Nous Portal、Cline等纷纷补贴,其能力大幅提升,价格却极低,让开发者更愿尝试开源模型,AI应用层或迎转机,且DeepSeek Code可能将至。

量子位