「开源数据」共找到 4899 篇相关文章
“DeepSeek 时刻” 一周年
本文回顾 2025 年 1 月 “DeepSeek 时刻” 后中国开源 AI 社区转折,分析其对全球开源生态的重塑。指出 DeepSeek R1 降低三门槛,推动战略转变,全球也积极应对新开源热潮。
Nature子刊封面:牛津提出首个百万级多模态心脏基础模型CSFM
牛津大学团队推出全球首个心脏传感基础模型CSFM,能统一分析多源数据,精准诊断房颤、预测死亡风险等。它打破设备壁垒,让偏远地区也能享用顶级心脏监护,推动全球医疗平权。
Snowflake CEO 复盘:为什么 LLM 时代企业需要一个 AI Data Cloud?
Snowflake曾是企业数据平台代表,随AI崛起,CEO Sridhar推动其转型为AI Data Cloud。Snowflake Intelligence上线,不造基础模型,专注放大数据价值,其可靠、计费合理,核心竞争力在数据。
企业数字化转型新引擎:MCP + LLM + Agent 架构赋能!
本文介绍MCP(Model Context Protocol)模型上下文协议,它是Anthropic于2024年11月底推出的开放标准,可统一大模型与外部数据源和工具通信协议,打破数据孤岛,有诸多优势,还适用于多个场景。
如何训练VLA?丰田研究院发布史上最大实验规模「保姆级」教程
丰田研究院和清华大学发布教程,用大量数据训练89个策略模型并验证。聚焦Co - training,研究五大模态、三种策略,对比不同架构,揭示有效和无效模态,还探讨CoT推理及多方面实验。
详细介绍!RAG 和 GraphRAG:了解何时(When)、如何(How)使用它们
文章详细介绍传统RAG和GraphRAG技术,前者通过向量搜索检索上下文,但无法体现数据关系;后者用知识图谱提升检索效果,亮点是构建图谱、整合信息。还指出两者优缺点,建议结合使用。
bootstrap 到十亿美元 ARR:Surge AI 这匹黑马如何颠覆 Scale 霸权 ?
Surge AI 成立于 2020 年,主创团队低调,短短几年业绩爆发。截至 2024 年 ARR 超 10 亿美元,超越 Scale AI。2025 年 7 月启动首次外部融资,其聚焦高质量数据标注,客户多为顶级科技公司。
SceneSplat: 基于3DGS的场景理解和视觉语言预训练,让3D高斯「听懂人话」的一跃
文章引入 SceneSplat,首个在 3DGS 上原生运行的端到端大规模 3D 室内场景理解方法,提出自监督学习方案,构建发布 SceneSplat - 7K 数据集,在多个实验中达 SOTA 效果。
估值 20 亿美元的语音输入法,开源平替已经 3 万 star
文章指出语音输入随着 AI 发展价值重估,介绍了开源工具 OpenLess,分析了商业订阅、开源桌面工具、大厂输入法三类玩家,给出四层评估框架,也提及开源风险,并对不同需求给出选择建议。
破解「个性化学习」长尾难题,巧用神经坍缩理论 | ICML 2025
当前个性化学习方法基于数据高质量且类别平衡的假设,但现实教育数据呈不均衡分布。华东师范大学和浙江大学团队在ICML2025提出NCAL方法,将神经坍缩理论引入该领域,解决教育数据长尾分布问题。