未标记数据」共找到 3105 篇相关文章

新闻资讯7

当200位具身从业者被拉进同一个屋子

量子位等联合发起沙龙,近200位具身从业者探讨具身智能从实验室走进物理世界的问题。乐聚工程师指出具身数据瓶颈,蚂蚁灵波郑可成介绍模型,上海交大李永露分享评测基准,圆桌对话探讨数据挑战与破局路径。

量子位
新闻资讯8

在「外滩大会·具身智能:从泛化到行动,重塑产业来」上,这些大牛都说了什么?

9月11日,机器之心联合出品的外滩大会见解论坛聚焦具身智能。多位学界和业界代表分享看法,如孙富春称训练场可破数据瓶颈,江磊指其是新型数据工厂。思辨和圆桌环节探讨技术路线、应用场景等关键问题。

机器之心
算法论文8

数据邪修大法好:仅用文本数据就能预训练多模态大模型

多模态大模型研发中,行业认为无图文对就无多模态能力。但ReVision研究表明,预训练阶段昂贵配对关系非必需,利用非配对数据统计信息修正文本表征,能实现跨模态互换,降低成本。

量子位
推荐文章7

无法蒸馏的美国市场,谁在分食 Frontier Labs 百亿美金预算?

本文围绕美国数据市场展开,分析了数据赛道的投资判断、公司增长难题、需求结构、最新趋势等。指出数据虽重要,但外部数据公司份额难线性外推;真实世界数据成新热点,各细分领域格局和投资方向不同。

海外独角兽
开源动态7

GraphQA:用自然语言对话分析图数据

数据常见但分析门槛高,需懂算法和代码。NetworkX 算法多却复杂,普通用户难上手。GraphQA 搭建桥梁,用自然语言接口替代复杂 API,智能选算法,继承 NetworkX 优势还解决易用性问题。

AI工程化
开源动态8

The Batch: 869 | 编码助手的训练数据

研究人员开发自动生成编码助手训练数据的流程。斯坦福等高校及阿里团队提出 SWE - smith 方法,从 128 个 Python 仓库入手合成漏洞、验证并生成修复样本,成果免费开放,有望改进 AI 辅助编程模型。

DeeplearningAI
新闻资讯7

数据的AI公司被抓到了

Reddit发现AI公司利用Wayback Machine开放性,绕过限制扒取大量历史数据用于模型训练。此前Reddit已对AI公司数据抓取设限,还起诉过违规公司。Reddit抵制该行为,宣布限制Wayback Machine索引其内容。

量子位
算法论文7

数据分布视角,重新认识下CoT

本文从数据分布视角重新审视大语言模型的思维链(CoT)推理。指出CoT并非真正推理,而是模仿,其效果受训练与测试分布差异影响。通过实验揭示CoT在分布偏移时性能退化,提醒勿过度依赖。

深度学习自然语言处理
开源动态8

中科院类脑大模型SpikingBrain,2%数据,百倍速度

中国科学院自动化研究所李国齐、徐波团队发布全球首款大规模类脑脉冲大模型SpikingBrain 1.0。它处理长文本比主流Transformer模型快超百倍,训练数据仅为2%。该模型采用新架构,降低计算复杂度,还可转换现有模型,且在国产GPU完成训练。

AIGC开放社区
7

Anthropic发布AI就业冲击报告,数据让人意外

Anthropic发布AI对劳动力市场影响的报告,基于真实数据和理论智能分析。提出“观察暴露度”新指标,揭示AI理论能力与实际应用差距大,还给出高危职业排行,分析受影响人群、安全职业等。

AI工程化