「评估指标」共找到 945 篇相关文章
AIAAJ | 西工大张巧、张伟伟等:多专家特征融合网络架构预测跨声速抖振气动噪声
为解决气动噪声数据中流动状态与空间位置分布不平衡导致的MLP预测精度不足问题,本研究提出多专家特征融合网络架构,以跨声速抖振气动噪声为算例评估,可降低MLP算法MSE,泛化性更好。
登顶 Arena!MiniMax 最新 Speech-02 模型屠榜:超越OpenAI、ElevenLabs,人声相似度99%
近期TTS模型领域发展火热,众多机构纷纷发力。MiniMax推出的Speech - 02模型登顶Arena榜单,在字错率和相似度等指标上表现出色,具备超拟人、个性化、多样性特点,性价比高,还创新架构解决了现有痛点。
超越DeepSeek-R1,英伟达开源新王登顶!14万H100小时训练细节全曝光
英伟达Llama - Nemotron系列模型超越DeepSeek - R1且全部开源。论文揭秘其训练关键,如用合成数据监督微调与强化学习等。还介绍构建阶段、架构设计等,评估显示该系列模型在多任务表现出色。
如何判断AI视频真假?综述动态、可溯源、可解释的检测体系 | ACL26
AI视频生成技术发展迅速,现有检测方法难满足需求。最新综述提出「事实保真度验证」目标,梳理出视觉与语言双视角的四层检测框架,还分析了检测方法演进、评测指标和数据集,为AI视频检测提供落地地图。
构建 AI 时代的知识底座:直播数据 LLM Wiki 实践
文章围绕直播数据 LLM Wiki 实践展开,指出领域知识沉淀面临挑战,引出 LLM Wiki。介绍其实际效果,如指标召回、代码生成等,阐述构建方法、架构设计、编译流水线、检索方式,还提及增量编译与持续 Lint,最后给出未来规划。
Generalist爆火背后:具身智能真正的竞争,已不在模型
Generalist AI发布的GEN - 1模型引爆具身智能领域,其多项指标出色,预示具身智能竞争从模型层转向基础设施层。行业关注焦点转移,数据正从‘静态数据集’演进为‘动态教育系统’,评测与仿真基础设施成关键。
挺意外的,Agent长期记忆潜力被AMemGym挖出来了
论文提出交互式在线策略评测框架AMemGym,它能反映AI助手长期记忆能力、驱动Agent自我进化记忆。它以结构化状态演化为骨架支撑自由对话评测,还对主流记忆系统做了扫描,带来评估与训练范式转换。
Anthropic 发布第四份人类经济指数报告:AI 对全球工作的影响仍然不均衡
Anthropic发布第四份经济指数报告,提出“经济基元”概念,用五个基础指标衡量AI使用情况。报告发现任务越复杂,AI加速效果越明显,不同国家使用方式有差异,还提及“去技能化”等情况及对生产力的影响。
LangChain Agent 年度报告:输出质量仍是 Agent 最大障碍,客服、研究是最快落地场景
LangChain对1300名行业人士调查,揭示AI Agent应用情况。超半数受访者已将Agent投入生产,客户服务、研究与数据分析是热门方向,但输出质量仍是落地最大障碍,成本不再是难题。
挖掘注意力中的运动线索:无需训练,解锁4D场景重建能力
香港科技大学(广州)与地平线团队提出VGGT4D,通过分析VGGT内部机制,利用注意力层运动线索,提出无需训练框架,在动态物体分割等任务表现优异,为低成本4D重建提供新思路。