「数据质量评估」共找到 3460 篇相关文章
Kimi K2.6背后的Agent Database:Agent-native 时代的数据 Infra 竞争,跟过去 30 年有何不同
TiDB Cloud 成 Kimi K2.6 供应商,为其 Agent 建站服务提供支持。Kimi K2.6 由 Agent 完成在线应用构建,与其他 AI 建站应用不同,它全托管且用户无需技术背景。该合作解决了成本和基础设施难题,展现了 Agent-native 时代数据 Infra 竞争的新特点。
互联网免费数据已被吃光,普通人反馈早没用了?前英伟达工程师:Transformer的原罪浪费算力,聊天机器人把GPU全糟蹋了
前英伟达工程师、Sail Research 创始人 Neil Movva 认为当前 AI 行业陷“延迟陷阱”,AI 终局应是后台 Agent。他执行“算力拾荒者战略”,想降低智能成本,还指出 Transformer 架构有缺陷,互联网数据被吃光等问题。
AMS最新AI4PDE综述:清华大学冯西桥教授团队白金帅等提出面向计算力学中物理和数据引导的AI框架的未来
本文综述人工智能赋能计算力学框架发展与现状,指出纯数据驱动、物理信息神经网络和算子学习方法虽有潜力,但在鲁棒性等方面有挑战。阐述四个研究方向,为复杂物理系统建模等开辟新途径。
红杉中国xbench全球首发,AI智能体真实战力揭榜!
红杉中国推出全新AI基准测试工具xbench及相关论文,采用双轨评估体系和长青评估机制,首期发布两个核心评估集并综合排名,还提出垂类评测方法论。它能追踪模型能力与实际场景价值,解决现有评估难题。
Sora2还在5秒打转,字节AI生视频已经4分钟“起飞”
字节和UCLA联合提出Self - Forcing++方法,无需更换模型架构或重收集数据集,就能生成分钟级长视频,最长达4分15秒,高质量且开源,在长、短时长生成上性能领先。
最火VLA,看这一篇综述就够了
ICLR 2026爆火领域VLA全面综述来了!作者Moritz Reuss是2025年Apple AI/ML学者奖得主。文中明确VLA概念,介绍八大趋势,指出评测失真问题,还提及未来需重视数据质量与上下文学习。
打破资源瓶颈!华南理工&北航等推出SEA框架:低资源下实现超强多模态安全对齐
本文介绍北航彭浩团队的 SEA 框架,针对多模态大模型低资源安全对齐难题,用合成嵌入替代真实数据,突破资源瓶颈。还构建 VA - SafetyBench 评估安全风险,实验验证了 SEA 低资源、高泛化优势。
「0污染」LLM理解基准来了!20000道题14个学科全覆盖,来自微软
MMLU-CF是微软亚洲研究院推出的无污染多任务语言理解基准测试,含20000道题、覆盖14学科。通过去污染规则和闭源测试集防数据泄露,保证评估结果可靠,已在Huggingface开放。
ACL 2026 Main | 不只是调用地图API,Spatial-Agent让大模型生成可执行地理分析工作流
大语言模型在空间领域应用广泛,复杂地理分析问题需组织自然语言成可执行流程。Spatial - Agent 加入 GeoFlow Graph 中间层,借用 GIScience 理论,实验显示能提升准确率,不过仍受数据质量等限制。
领域驱动的 RAG:基于分布式所有权构建精准的企业知识系统
银行技术供应商为解决文档和专业知识获取难题,探索用 RAG 技术,严格将 AI 作咨询工具。重新分配 RAG 实施所有权,采用元数据方法,探索伸缩性解决办法,构建完整应用并评估性能,结果令人振奋。