「结构化数据建模」共找到 3025 篇相关文章
大模型学会拖进度条看视频了!阿里新研究让视频推理告别脑补,实现证据链思考 | ICLR 2026
阿里巴巴未来生活实验室团队解决多模态大模型视频推理难题,推出ReWatch数据集和ReWatch - R1模型。数据集克服现有训练数据痛点,模型用SFT + RL范式及创新奖励机制,实验成绩SOTA。
SceneSplat: 基于3DGS的场景理解和视觉语言预训练,让3D高斯「听懂人话」的一跃
文章引入 SceneSplat,首个在 3DGS 上原生运行的端到端大规模 3D 室内场景理解方法,提出自监督学习方案,构建发布 SceneSplat - 7K 数据集,在多个实验中达 SOTA 效果。
破解「个性化学习」长尾难题,巧用神经坍缩理论 | ICML 2025
当前个性化学习方法基于数据高质量且类别平衡的假设,但现实教育数据呈不均衡分布。华东师范大学和浙江大学团队在ICML2025提出NCAL方法,将神经坍缩理论引入该领域,解决教育数据长尾分布问题。
大模型长脑子了?研究发现LLM中层会自发模拟人脑进化
帝国理工学院等机构研究人员发表论文,指出大型语言模型(LLM)学习中会自发演化出类似生物大脑的协同核心结构。研究对多个模型剖析,揭示其内部处理规律,为大模型可解释性开辟新路径。
GenEnv:智能体与环境模拟器之间的难度对齐协同进化 | 直播预约
训练高性能 LLM 智能体受限于真实世界交互数据的成本和特性,为此推出 GenEnv 框架,它建立难度对齐协同进化博弈,能让智能体表现提升,减少数据使用量,为扩展能力提供数据高效路径。
TDSQL Boundless:AI时代的多模态数据库
在AI与数据分析处理技术融合的当下,传统数据库架构面临诸多挑战。腾讯云TDSQL Boundless推出,通过统一架构处理多模态数据。本文从核心架构、关键技术特性及对未来数据平台建设的启示三方面解读。
训练世界模型,开始从人类的肌肉和脑子里偷师了
具身智能数据竞争进入新阶段,第一视角视频虽缓解数据量问题,但未记录人行动的原因及大脑身体实时修正。FaceMind提出Ego - NeuroLoop数据范式,配套NeuroMatrix和NeuroBooster,将训练数据从“行为库”推向“闭环库”。
TruthfulRAG,用知识图谱硬刚RAG知识冲突
RAG系统存在知识冲突问题,现有解决方法治标不治本。TruthfulRAG将非结构化文本转化为结构化事实,通过图构建、图检索、冲突解决三大模块解决冲突,实验显示其表现优异,结构化表示还提升了LLM置信度。
Databricks × Snowflake 纷纷下注,PostgreSQL 成 AI 时代数据库标准?
文章结合作者对数据基础设施的实践与反思,探讨生成式AI时代数据系统的挑战与机遇。介绍数据基础设施新趋势,分析Neon、Supabase等公司受关注原因,指出PostgreSQL成行业标准,还提出Data Warebase概念及优势和应用场景。
14k颗星!你的电脑屏幕,正在成为AGI的“眼睛”!这款开源神器让你一键记录所有操作
介绍开源项目ScreenPipe,它是跨平台桌面数据抓取API,能全维度记录数据,有沙盒化插件系统等功能。因能为AGI提供数据、对开发者友好而火,还给出安装和创建插件命令,称其有成为AGI时代“现实采集器”的野心。