评估指标」共找到 945 篇相关文章

新闻资讯8

Scaling没有墙!Anthropic CEO:AI实验室真相远超公众想象

Anthropic CEO Dario Amodei在摩根士丹利会议称Scaling Law未撞墙,2026年将激进加速。他用棋盘稻米寓言比喻,称当前处第40格,前39格增长只是前奏。还透露代码生成是AI能力爆发指标,Anthropic或在RSI取得进展,且重视人才文化。

新智元
新闻资讯8

美国ATOM报告:Qwen称霸武林,中国统治开源世界

美国ATOM报告显示,2025年夏中国开源语言模型超美国,下载、使用量差距显著。Qwen成王者,DeepSeek在大模型领域表现出色。新势力如Nvidia、OpenAI等也在追赶,报告引入新指标衡量模型热度。

AIGC开放社区
产品应用8

阿里 Qwen3-TTS 两大更新直接封神!支持跨物种音色克隆,3 秒复刻!

阿里通义上线 Qwen3-TTS 两大核心能力,VoiceDesign 支持全文本控制音色特征,VoiceClone 能 3 秒音频跨语言、跨物种克隆音色。更新指标亮眼,如 0.1 秒级生成速度等,还可上手体验。

开源星探
7

一份最新具身智能中的世界模型&安全综述

本文分享2篇具身智能世界模型和安全挑战的综述。2025年10月的综述用三维坐标轴整合文献。还介绍世界模型分类、性能表现,围绕自动驾驶与机器人领域分析安全隐患并实证评估

PaperAgent
推荐文章7

从 Shopify 构建 Agent 的经验中可以学到的

Shopify 分享构建 Agent 经验,采用主流 Agentic Loop 架构。给出4条打造 AI 智能体核心建议,还指出工具控制在20个内,可用 SubAgent 分摊上下文;用人类标记结果作基准让 LLM 评估 Agent 生成结果。

宝玉AI
算法论文8

ICCV 2025 | 机器人自主探索未知复杂空间?GLEAM破解主动探索建图的泛化难题

文章聚焦机器人在未知复杂空间的自主探索建图难题。香港中文大学与上海人工智能实验室联合提出GLEAM,搭建GLEAM - Bench基准,设计通用策略,实现零样本适配未知空间,在多指标上超越先前方法。

机器之心
算法论文8

75%预训练数据都能删!Jeff Dean新作:全自动筛除低质量数据

Google DeepMind团队开发的DataRater可全自动评估数据质量,用元学习筛选有价值数据,提升模型训练效率。它能减少计算量、提高性能,在低质量数据集效果佳,还能跨模型规模泛化。

新智元
算法论文8

打破资源瓶颈!华南理工&北航等推出SEA框架:低资源下实现超强多模态安全对齐

本文介绍北航彭浩团队的 SEA 框架,针对多模态大模型低资源安全对齐难题,用合成嵌入替代真实数据,突破资源瓶颈。还构建 VA - SafetyBench 评估安全风险,实验验证了 SEA 低资源、高泛化优势。

AI前线
算法论文8

33%!Claude、GPT、Gemini 在真实网站上集体翻车,ClawBench 把 AI agent 打回原形

ClawBench让AI在144个真实网站执行153个日常任务,结果惨烈,如Claude Sonnet 4.6每三任务翻车两个,GPT - 5.4仅完成10个。它还揭示AI在真实环境的问题,为评估模型提供标尺。

机器之心
开源动态7

第六章 Coding优先编的是「过程与约束」,不是「参数」

本章以开面包店类比训练大模型,介绍 AutoResearch 自主实验框架。它将研究生助理工作循环交给 Agent,在固定时间用单一指标判断好坏。仓库获约 64.7K Stars,Karpathy 设计哲学为极简主义与固定约束。

CourseAI