元数据性能」共找到 4587 篇相关文章

产品应用8

腾讯王者归来:混图像3.0登顶LMArena!一手实测全球最强图像AI

LMArena最新榜单显示,腾讯「混图像3.0」在文生图任务中夺冠,碾压谷歌Nano banana和字节Seedream 4。它9月28日开源,性能对标闭源模型,有强大推理、语义理解能力,支持中英文长文本渲染。

新智元
算法论文8

统计可控数据合成!新框架突破大模型数据生成局限,麦吉尔大学团队推出LLMSynthor

麦吉尔大学团队提出新方法LLMSynthor,让大模型成结构感知的数据模拟器,为隐私敏感、数据稀缺场景生成不泄密的高质量替代数据。它通过结构推理、统计对齐等步骤实现,有理论保障,多场景实测效果佳。

量子位
算法论文8

重新审视SFT的泛化能力:优化动态、数据与模型能力的条件性分析

上海人工智能实验室等联合研究质疑了‘SFT倾向于记忆,RL实现泛化’观点,指出SFT泛化是条件性现象,受优化动态、训练数据、基模型能力影响,还揭示长思维链SFT会带来安全性能退化。

AI科技评论
开源动态8

字节Seed新方法!开源8B代码模型:自己筛数据训练自己,同量级SoTA,还能超越百亿级对手

传统code大模型依赖人工筛选数据,成本高、效率低。而Seed - Coder团队让LLM自己筛选数据训练自己,打造8B参数轻量级开源代码模型,性能超百亿级对手,不过也存在通用和数学能力短板。

深度学习自然语言处理
算法论文8

字节最新大模型秘籍:只挑能有推理潜力的数据训练!1.3B模型无需标签自动挑选

字节Seed团队发布AttentionInfluence成果,用1.3B模型给7B模型选数据,无需训练和标签。通过比较基础与弱化模型损失差异评估数据影响,在多基准测试提升模型性能,还能结合分类器全面提升表现。

量子位
新闻资讯7

甲骨文副总裁吴承杨:AI 放大了数据优势,数据融合至关重要

甲骨文公司副总裁吴承杨称AI放大其数据优势,多模融合数据库至关重要。中国区技术咨询部高级总监嵇小峰表示企业构建Agent AI要关注数据访问需求和安全。Oracle用一体化架构解决融合问题,还介绍了相关技术及应用。

AI前线
推荐文章7

具身智能最“脏”的活,被三个老炮干成了亿生意|甲子光年

具身智能行业数据是关键卡点,海量数据中能用于训练具身模型的数据稀缺。智域基石提出“数据编译”理念,搭建包含五个环节的管线。该公司已获数千万天使轮融资,成立4个月订单近亿,从工业场景切入,规划了三阶段发展路径。

甲子光年
算法论文8

训练数据枯竭怎么办?首篇「数据价值密度」综述理清思路

上海交通大学与上海人工智能实验室团队发布首篇「数据价值密度」综述。提出“数据价值密度”概念并定义,建立分类框架梳理现有工作,还指出该领域面临的挑战,为大模型训练提供指南。

机器之心
算法论文8

LLM的下一战:从狂卷数据到精算数据

大模型竞争核心正从比拼数据规模转向数据使用效率和风险管理。文章分享2025两篇论文,介绍高效训练和机器遗忘两赛道,前者有数据价值飞轮5大模块,后者提出三时段分类法、三层次遗忘及评价指标全景。

PaperAgent
7

没等VC下场,机器人厂商们先投了一家数据公司

2026年具身智能市场火热,智域基石获灵初智能等四家企业数千万天使轮融资。其定位第三方数据公司,核心团队背景互补,明确不做本体、模型等四件事,还构建自动化编译管线处理数据

AI科技评论