评估指标」共找到 945 篇相关文章

新闻资讯7

「AI 100」榜单启动招募,AI产品“年会”不能停丨量子位智库

2025年国内AI产品领域涌现众多关键词与颠覆性产品。为把握市场动向,量子位智库2025年度「AI 100」榜单开启招募,分三大板块评选,采用双重评估体系,含多周边内容。

量子位
开源动态8

社区供稿丨以小博大!Nanbeige4-3B重磅开源:硬刚Qwen3,挑战小模型能力新高度

近年来大语言模型发展陷入‘参数军备竞赛’,成本高昂。Boss直聘南北阁实验室发布Nanbeige4 - 3B,仅30亿参数,在预训练和后训练阶段采用多种创新技术,在多方面媲美甚至超越大模型。

Hugging Face
开源动态7

这个框架让大模型省下50%内存,合并专家不如直接删掉?

Cerebras Research提出REAP框架,通过专家剪枝和合并技术压缩SMoE模型,能让模型‘瘦身’并保持性能,可省50%内存,但社区测试有不同结果,且存在调度开销等问题。

AI工程化
开源动态8

大模型开发者必读!拆解世界级AI模型的诞生,Hugging Face把4年模型训练经验写成了一本开源指南

Hugging Face发布《The Smol Training Playbook》,分享约4年构建SOTA模型和数据集的经验。手册涵盖是否训练、训练何种模型、如何训练等内容,强调数据质量重要性,还介绍了模型设计、训练中的实践与教训。

AIGC开放社区
算法论文8

NeurIPS 2025 Spotlight | 你刷到的视频是真的么?用物理规律拆穿Sora谎言

随着生成式AI发展,合成视频以假乱真,现有检测方法难泛化。本文介绍发表于NeurIPS 2025的文章,提出NSG统计量和NSG - VD检测方法,对未知生成范式检测效果好,实验表现超越现有方法。

机器之心
开源动态8

100美元、8000行代码手搓ChatGPT,Karpathy最新开源项目爆火,一夜近5k star

AI大神Andrej Karpathy发布开源项目nanochat,可教你100美元自建ChatGPT,覆盖LLM训练和推理。项目有8000行代码,不到12小时获超4500 star,功能丰富,但他认为它不适合个性化应用。

机器之心
开源动态8

Embodied Arena:业界首个统一具身大脑评测平台重磅发布,30+模型全面对比揭示关键洞察

具身智能火热,研究者常感茫然。Embodied Arena评测平台上线,它全面统一且持续演进,涵盖22+基准测试和30+模型,构建评估体系,揭示关键洞察,为具身模型发展指引方向。

AI科技评论
开源动态8

B站出海的强有力支柱:最新开源文本转语音模型IndexTTS-2.0标志零样本TTS进入双维度时代

B站Index团队开源文本转语音模型IndexTTS - 2.0,引发关注。它解决了传统AR模型时长控制难题,实现零样本TTS双维度控制,在多方面表现优异,为B站出海及AIGC应用奠定基础。

机器之心
产品应用8

PosterGen:告别学术海报制作烦恼,从PDF一键生成「演示级」可编辑PPTX学术海报

许多研究者制作学术海报耗时费力,现有自动化方法有缺陷。联合团队推出PosterGen,能将论文PDF转成可编辑PPTX海报。它有核心创新,遵循四大设计原则,工作流由四个智能体构成,实验证明其有效。

机器之心
算法论文8

科研智能体「漫游指南」—助你构建领域专属科研智能体

该综述提供科研智能体构建指南,提出三级分级系统,阐述构建流程与能力增强方法,涵盖知识组织、注入、工具集成,还提及基准评估和未来研究方向,促进AI与自然科学融合。

机器之心