评测标准」共找到 946 篇相关文章

新闻资讯7

AI生成内容行标来了!工信部立项管理,欢迎参与起草

据工信部通知,清华大学牵头的《元宇宙 共性服务 数字内容管理要求》行业标准获批立项并征集起草单位与专家。此为全国首部聚焦元宇宙数字内容标准,覆盖多环节,助力产业健康发展。

带你学AI
开源动态7

让 AI 像真人一样操控手机完成各种复杂任务

MobiAgent是强大的移动端智能体系统,含智能体模型家族、加速框架、评测基准。能让AI像真人操控手机完成复杂任务,提供开箱即用App,内置经验检索模块可自动优化规划。

GitHubStore
算法论文8

谢赛宁×李飞飞×LeCun首次联手!寒武纪-S「空间超感知」AI震撼登场

Yann LeCun、李飞飞和谢赛宁联手发布论文「Cambrian - S:迈向视频中的空间超感知」。他们认为LLM虽能力强,但无法像人类一样感知世界,为此构建Cambrian - S系列模型,开源相关数据和模型,还开发了新原型。

新智元
算法论文7

北航董雷霆等:数字工程与数字孪生在航空疲劳与结构完整性领域的研究进展与展望 | 航空学报CJA

疲劳与结构完整性贯穿飞机全生命周期,数字工程与数字孪生技术为其管理提供高效方案。文章梳理该技术研究进展、工程案例,涉及设计验证和使用维护两阶段,还对未来发展提出展望和建议。

力学与人工智能
开源动态8

只有0.9B的PaddleOCR-VL,却是现在最强的OCR模型。

近期OCR赛道火热,作者应读者要求解读PaddleOCR-VL。它是百度PaddleOCR系列新模型,仅0.9B参数,在OmniDocBench v1.5评测多项领先。其架构高效,实测处理各类文档能力强,已开源。

数字生命卡兹克
推荐文章8

大语言模型的解耦:人工智能基础设施的下一轮进化

人工智能模型发展快,但基础设施滞后,传统单体式服务器架构成瓶颈。文章介绍大语言模型推理的预填充与解码阶段差异,指出解耦架构可突破困境,还阐述其经济影响、实施策略、应用案例及未来展望。

InfoQ
算法论文7

斯坦福:优化器「诸神之战」?AdamW 凭「稳定」胜出

斯坦福大学 Percy Liang 团队研究指出,虽有不少声称能显著加速的优化器替代方案,AdamW 仍为预训练稳健首选,但矩阵型方法在特定数据–模型比例下优势明显。研究还揭示了现有研究的方法论缺陷。

机器之心
算法论文8

OpenAI罕见发论文:我们找到了AI幻觉的罪魁祸首

AI“幻觉”是阻碍完全信任AI的关键障碍,目前无根治良方。OpenAI罕见发论文揭示其根源,指出标准训练和评估程序奖励猜测,应加大对自信错误的惩罚,奖励表达不确定性。

机器之心
新闻资讯8

吴恩达大谈,AI时代就业现状、生存法则。

吴恩达发长文谈AI就业生态,指出市场淘汰只会氛围编程的新人与拒绝用AI的老人。他面试看重三点,直言愿雇懂AI的应届生。约30%CS知识过时,还提及AI面试优势。

探索AGI
产品应用7

Claude Code凭什么牛?大模型团队天天用自家产品,发现bug直接就改了

Claude Code虽有争议,但很成功,4个月用户达11.5万。Claude Code负责人透露构建细节,如产品理念、评估标准、反馈机制等,还阐述编程领域变化、模型与工具共同进化等内容。

机器之心