「基准数据集」共找到 3259 篇相关文章
你的「龙虾」真记得你吗?剑桥发布长期个性化记忆基准ATM-Bench
剑桥大学团队开源面向AI个人助理的长期记忆基准测试ATM - Bench,评估AI面对真实生活数据时能否「记住你」。实验结果不佳,专用和通用智能体系统准确率低,凸显长期个性化记忆问答难题。
迈向原生全模态AI智能体:人大&小红书发布OmniGAIA新基准
中国人民大学等团队推出 OmniGAIA 新基准及 OmniAtlas 训练框架。OmniGAIA 含 360 个高难度任务,覆盖多领域。实验显示闭源与开源模型差距大,OmniAtlas 显著提升开源模型表现,并指出未来全模态智能体发展方向。
当AI成为预言家:大数据时代,我们正在失去理解世界的能力吗?
文章借神经科学家Grace Huckins观点,探讨AI时代人类理解世界能力问题。以‘微处理器论文’实验为例,指出大量数据未必带来理解。还阐述理解与预测分离、科学理解危机等,强调理解应是科学核心。
腾讯Youtu-agent 不会代码,也能搞定数据分析+深度研究+HTML报告
腾讯开源的Agent框架Youtu - agent灵活高性能,可用于数据分析等多任务。基于openai - agents构建,适配多种模型API等。突出优势是能自动化生成智能体及其配置,采用YAML配置方案,有内置‘元智能体’,还完全异步。
隐私优先的本地匿名化小模型:在数据离开设备前保护个人信息
最强 AI 模型在云端,安全数据在本地,这一矛盾困扰着想用 AI 处理敏感信息的人。Freysa 团队提出解法,不重写提示,只替换敏感信息,用小模型实现精准匿名化,有实用价值。
POF|清华大学张宇飞团队:采用数据驱动湍流模型的三维增升装置模拟
传统RANS方法预测分离流动有挑战,数据驱动湍流模型泛化性能有局限。清华大学张宇飞团队研究其在复杂三维增升装置应用,验证SST - CND模型泛化能力及修正项迁移能力,证明其可用于真实工程流动问题。
让AI真正懂数据:猫超Matra项目中的AI知识库建设之路
文章聚焦猫超Matra项目的AI知识库建设。猫超数据体系庞大但有治理难题,促使Matra项目诞生,旨在实现智能取数。文中详述知识库设计、实践及效果,还提及未来在准确性、保鲜性和能力拓展上的规划。
95%的人还在手动提取数据,用这个工具秒变结构化
文章介绍Google开源的LangExtract,它基于大语言模型,能将非结构化文本转为结构化数据。有精准溯源、少样本定义等6大优势,可3步完成安装配置,还介绍基础使用、长文档处理、多模型支持及实战案例等内容。
维纳智能登上Nature通讯:AI不只会回答问题,开始生成高精度行业数据
维纳智能登上Nature通讯,其让大模型自动生成高精度推理数据,用闭环反馈驱动专业Agent自主演化。该公司在多领域交出工业级精度答卷,还解决了Agent泛滥的困局,推出多款创新产品。
Energy | 西工大史子颉、高传强等:三维风力机叶片动态失速数据融合建模研究
动态失速威胁风力机叶片安全与发电效率,传统模型有局限。西工大团队开发数据融合神经网络与动量叶素理论耦合框架,能高效高精度预示三维叶片动态失速,虽部分工况有偏差,但预测精度显著提升。