大数据任务」共找到 7722 篇相关文章

开源动态8

攻克模型「表格盲区」!ST-Raptor框架发布,实现复杂半结构化表格的精准理解与信息抽取

半结构化表格布局多样、结构复杂,让自动化数据处理困难。上海交等团队发布 ST - Raptor 框架,提出 HO - Tree 数据结构及树上操作,构建 SSTQA 数据集,提升表格问答准确率,弥补模型处理短板。

机器之心
新闻资讯8

Figure抛弃10万行C++代码!用1000小时人类数据训练神经网络,实现全身控制基础模型

美国机器人公司Figure推出具身脑Helix 02及家务demo。其搭载的Figure 03在厨房自主完成复杂任务,且实现端到端全身控制。新引入的System 0基于人类数据训练,替代量手写代码,还展示多种灵巧操作。

量子位
算法论文8

模型能“原地”改参数了!字节Seed&北新论文:测试时推理无需加层重训练

字节Seed和北研究团队提出In - Place TTT方案,让模型能“原地改参数”。它复用Transformer的MLP模块,解决现有TTT架构不兼容、计算效率低和优化目标不匹配问题,实验证明可提升模型长文本任务表现。

量子位
算法论文8

怎么量化机器人数据价值?ATHENA将影响函数扩展到十亿参数VLA,313×加速筛选高价值数据

具身智能进入数据scaling时代,VLA模型训练中数据并非越多越好。上海交同济等校团队提出ATHENA框架,将影响函数扩展到十亿参数VLA模型,解决计算和筛选难题,实现313倍加速,实验证明其用更少数据获更好效果。

机器之心
算法论文8

GPT-4o-Image仅完成28.9%任务!上海AI实验室等发布图像编辑新基准,360道人类专家严选难题

上海人工智能实验室等团队针对图像编辑AI提出问题,推出RISE任务及配套评测基准RISEBench。测试九个视觉编辑模型,结果显示当前模型完成复杂指令能力欠缺,闭源与开源差距

量子位
算法论文8

“坏”数据让模型更“好”?重新审视数据过滤

传统观点认为型语言模型预训练应过滤“坏数据”,但论文《When Bad Data Leads to Good Models》提出反直觉观点,适度加入有毒数据,通过后训练技术可降低模型毒性,保持一般能力,挑战常规做法。

深度学习自然语言处理
算法论文8

从「能用」到「好用」:数据可视化的三个维度,你还在第一层吗?——人提出图表创作新方式

数据可视化面临静态视觉与动态叙事挑战,如设计繁琐、动画门槛高、交互难复用。中国人民学IDEAS Lab团队与山东学交叉研究中心推出PiCCL、CAST、Libra,解决创作难题,还探索用模型提升可视化效率。

量子位
算法论文8

0.01%参数就能接近全量微调!低数据微调极致省参方案来了 | ACL'26

瑞典隆德学与Google DeepMind团队研究模型微调省参方案。发现低数据场景下,微调Value投影中的b(v)比b(q)或b(k)性能更好。该研究已被ACL 2026接收,集成进Hugging Face - PEFT库。

量子位
开源动态8

全能高手&科学明星,上海AI实验室开源发布『书生』科学多模态模型Intern-S1 | WAIC 2025

7月26日,上海AI实验室在WAIC 2025上发布并开源『书生』科学多模态模型Intern-S1。它首创‘跨模态科学解析引擎’,在多学科专业任务上超越顶尖闭源模型,多模态综合能力领先主流开源模型。

OpenMMLab
开源动态7

AI还不会独自问诊,o3准确率仅为51.12%,上交×SII开源高难度复杂疾病诊断测评集

上海交与SII团队开源高难度复杂疾病诊断测评集DiagnosisArena。测试显示,现有模型在复杂临床诊断任务中表现不佳,o3准确率仅51.12%,且选择题设置无法反映其真实能力。

量子位