大数据任务」共找到 7719 篇相关文章

算法论文8

谷歌DeepMind「粪坑淘金」全新方法,暗网毒数据也能训出善良模型

谷歌DeepMind研究团队发表论文提出生成式数据精炼(GDR)方法,不直接生成新数据,而是用模型净化原始数据,保留有用信息。该方法能解决数据枯竭、隐私等问题,实验显示效果良好。

新智元
开源动态8

阿里通义开源「推理+搜索」预训练新框架:小模型媲美模型,多个开放域问答数据集表现显著提升

阿里通义实验室开源通用预训练框架MaskSearch,引入检索增强型掩码预测任务,兼容两种训练方法。实验显示,它在多数据集提升模型性能,小模型能媲美模型,还验证了训练方式、策略及奖励函数的效果。

量子位
算法论文8

X-SAM:从「分割一切」到「任意分割」:统一图像分割多模态模型,在20+个图像分割数据集上均达SoTA

中山学、鹏城实验室、美团联合提出X - SAM,统一图像分割多模态模型。它将分割范式扩展,设计通用输入输出,采用端到端架构和三阶段训练策略,在超20个数据集达最优,为图像分割研究开辟新方向。

机器之心
算法论文8

具身智能奇点已至!超越π*0.6,极佳视界自我进化VLA模型拿下世界第一

极佳视界具身模型 GigaBrain-0.5M*依托世界模型实现自我进化,在多真实任务近 100% 成功,超 π*0.6 成 SOTA。其提出基于世界模型的强化学习范式,用超万小时数据训练,推动通用具身智能发展。

新智元
推荐文章7

智源技术分享:模型行业应用新模式和关键实现路径

在 AICon 会上,智源研究院周华分享模型行业应用。分析落地问题,提出以模型为核心的技术路径,涵盖数据、训练等环节,还给出数据生产流程建议,分享最新开源成果。

InfoQ
开源动态8

突破具身智能任务规划边界,刷新具身脑多榜单SOTA,中兴EmbodiedBrain模型让具身脑学会「复杂规划」

当前主流语言模型在具身任务场景面临瓶颈,中兴星云脑团队推出具身视觉 - 语言基础模型 EmbodiedBrain,构建全流程创新框架,在架构、数据训练、评估体系等方面有突破,还将开源成果推动生态发展。

机器之心
算法论文8

年度AI论文!全球三顶尖模型的防蒸馏机制全面告破:小模型“套出”模型隐藏思维链,Kimi-K3重现概率异常

这篇论文指出三前沿AI模型厂商API有密码学旁路漏洞,攻击者用轻量级模型就能恢复模型隐藏思维链数据。还揭示部分模型训练或借鉴模型思维链,此漏洞也致企业数据隐私安全问题。

AI前线
算法论文8

清华刘知远团队:高质量LLM训练数据获取新方法!成本降90%,性能提升

清华刘知远团队论文提出全新数据筛选方案,解决传统数据筛选验证慢、主观性强问题。发明‘半成品加工法’降成本,用fastText筛数据,筛出Ultra - FineWeb数据集,提升模型性能,还计划拓展到专业领域。

深度学习自然语言处理
算法论文8

牛津VGG、港、上交发布ELIP:超越CLIP等,多模态图片检索的增强视觉语言模型预训练

牛津VGG、港、上交团队论文提出ELIP方法,用学术界资源增强视觉语言模型预训练,用于文字 - 图片检索。该论文被会接受并获最佳论文提名。ELIP可应用于多个模型,实验显示能显著提升图片检索表现。

机器之心
开源动态8

还在为AI数据发愁?张文涛和鄂维南院士团队推出Data-centric AI系统

近年来模型发展由科技公司主导,其数据资源不公开,学术界构建优化数据难。张文涛和鄂维南院士团队推出DataFlow系统,可实现数据治理,有算子和流水线,支持文本模态,多模态版待推出。

机器之心