数据服务平台」共找到 4003 篇相关文章

算法论文8

“坏”数据让模型更“好”?重新审视数据过滤

传统观点认为大型语言模型预训练应过滤“坏数据”,但论文《When Bad Data Leads to Good Models》提出反直觉观点,适度加入有毒数据,通过后训练技术可降低模型毒性,保持一般能力,挑战常规做法。

深度学习自然语言处理
开源动态8

港科大(广州)联合腾讯AI平台部开源VibeWorlding,3D世界构建迎来Vibe Coding时刻?

香港科技大学(广州)联合腾讯AI平台部提出VibeWorlding,是可通过多轮对话等自主构建和编辑交互式3D世界的多模态智能体框架。团队开源多项数据,其模型经强化学习后表现超GPT - 5.5等。

机器之心
新闻资讯8

刚刚,Claude 正式杀入华尔街!

Anthropic 宣布推出 Claude for Financial Services,扩展金融服务功能,有 Excel 插件,还与 Moody's、LSEG 等金融数据平台整合。Citi、RBC Capital Markets 等华尔街巨头纷纷入局。

AGI Hunt
算法论文8

训练数据爆减至1/1200!清华&生数发布国产视频具身基座模型,高效泛化复杂物理操作达SOTA水平

清华大学与生数科技联合研发Vidar模型,首次让通用视频大模型长出‘手脚’,实现从虚拟到真实世界物理执行的跨越。它降低数据门槛,突破跨本体泛化困境,为服务机器人应用奠定基础。

量子位
新闻资讯8

对谈 Chai-2 核心科学家乔卓然:抗体生成成功率提升百倍,分子生成平台是药物研发的 GPU|Best Minds

文章访谈 Chai Discovery 创始科学家乔卓然,探讨 Chai-2 设计理念与行业意义。Chai-2 能零样本生成活性抗体,成功率提升百倍,将开发周期从数月缩至两周。未来分子生成平台或成药物研发的 GPU,合成数据将成“第三模态”。

海外独角兽
推荐文章7

关于机器人数据,强化学习大佬Sergey Levine刚刚写了篇好文章

训练大模型难度随规模和应用拓展而增加,所需数据海量。机器人领域获取训练数据成本高,研究者尝试找替代方案。强化学习大牛Sergey Levine分析数据组合,认为鱼和熊掌不可兼得,替代数据有局限。

机器之心
新闻资讯7

全球看中国,灵初智能用10万小时人类数据写下具身智能的中国答案

2026年,“世界模型”成具身智能高频词。灵初智能联合创始人陈源培认为其非核心方向,而是数据迁移工具。灵初关注人类操作数据转化,在10万小时量级上可大幅替代真机数据,还介绍了系统模块、数据集及商业化阶段等情况。

机器之心
推荐文章7

技术更新 or 组织重塑,企业如何用好“数据智能”?

InfoQ《极客有约》X AICon 直播栏目邀专家探讨企业数据智能应用。谈及构建数据集、优化检索效率等问题,还分析数据准备挑战、DeepResearch 优势,指出数据智能落地面临组织与技术层面的挑战。

InfoQ
开源动态8

The Batch: 849 | 用于训练网页智能体的生成数据

开发网页智能体常需大量人力标注训练样本,卡内基梅隆大学与亚马逊团队实现训练数据生成自动化。他们构建数据集,通过智能体工作流程生成数据,微调后 Qwen3 - 1.7B 表现出色,还公开数据与方法。

DeeplearningAI
推荐文章7

Agent时代,为什么多模态数据湖是必选项?

AI时代,数智化底层是基建深耕。企业要构建多模态数据湖,因其能处理多模态数据,唤醒沉睡数据,驱动业务,还提供工程确定性。火山引擎给出升级路线及选型指南,其多模态数据湖已在多行业落地。

机器之心