「数据性能」共找到 4105 篇相关文章
全面评估多模态模型视频OCR能力,Gemini 准确率仅73.7%
MME - VideoOCR团队评估多模态大模型(MLLM)视频OCR能力。构建精细任务体系和高质量数据集,评测18个主流MLLM。即便如Gemini - 2.5 Pro,准确率仅73.7%,暴露出MLLM在视频OCR领域能力局限。
大概念模型:AI 推理的新范式
大概念模型(LCM)是自然语言处理新范式,侧重结构化推理和理解,与 LLM 不同。它依赖结构化知识,可模拟专家思维,解决当前 AI 缺陷,文章还介绍其架构、应用、局限,探讨与 LLM 结合的未来发展。
RSS 2025|物理驱动的世界模型PIN-WM:直接从视觉观测估计物理属性,可用于操作策略学习
国防科大、深圳大学、武汉大学团队提出物理驱动的世界模型PIN - WM,能从视觉观测辨识刚体物理属性。还提出PADC提升迁移性能,经实验验证其在非抓握式操作技能Sim2Real迁移中表现出色。
刚刚!北大校友Lilian Weng最新博客来了:Why We Think
北大校友Lilian Weng更新博客《Why We Think》,回顾利用测试时计算的研究进展,探讨让模型“思考更久”的方法。文中介绍了思维链、潜变量建模等策略,还提及多种提升生成质量的策略,如并行采样与序列修订,以及强化学习提升推理能力等内容。
微软裁撤 Python 之父的嫡系核心团队,CPython 团队没了
近日微软全球裁员,软件工程岗位受打击大。Faster CPython 团队多名核心人员被裁,该团队由 Python 之父牵头,推动了 Python 性能改进。同时,AI 总监 Gabriela de Queiroz 也被解雇,引发各方关注和讨论。
开源播客TTS神器!高效TTS模型:Muyan-TTS,0.33秒生成1秒音频,零样本语音合成!
介绍新发布的开源TTS模型Muyan - TTS,它专为播客场景设计,以超低延迟实现零样本语音合成,预训练大量播客数据,支持长内容连贯生成,还介绍了使用步骤、适用场景等。
美国州政府生成式AI应用报告
今年2月,美国阿拉巴马州州长签署行政命令推动生成式AI在州政府大面积应用,并发布深度应用报告。报告涵盖应用现状、伦理风险与策略、数据管理、政策治理等方面,为生成式AI在政府应用提供指引。
今夜的荣光属于MiMo V2.6。
本文作者实测对比同日发布的Grok 4.7与小米MiMo V2.6两大模型,认为MiMo V2.6在性能、价格、速度上满足大模型"不可能三角",体验超预期且全面开源,对AI从业者实用性极强。
本地该怎么做RSI?我们与StartLux CTO聊了聊
菲尔兹奖得主联名信引发AI数学研究争议,前沿研究开始防备云端AI,但本地AI能力不足。本文专访StartLux CTO郭权玮,深度讨论本地RSI实践路径,披露Auto Research方法、实验数据与安全方案,介绍本地模型研发进展。
RSI离我们有多远?这家中国团队给出了第一梯队的工程解
目前行业探讨大模型的RSI时,常陷入思维定势。EvoMap团队没有盲目跟风,而是提出极具现实意义的工程新路径,构建自进化智能体,让经验在网络流转,还以硬核数据证明其体系有效性。