大模型数据」共找到 9982 篇相关文章

新闻资讯7

爱思唯尔把Meta告了:拿Sci-Hub盗版论文训练模型

学术出版巨头爱思唯尔等多方原告起诉Meta,指控其未经授权获取、复制受版权保护的学术论文训练Llama模型数据源于Common Crawl和盗版平台。Meta以‘合理使用’抗辩,AI版权合法性尚无明确判例。

量子位
算法论文8

赵恒爽团队论文:让扩散模型既拿高分又不「作弊」丨CVPR 2026

扩散模型虽能生成逼真图像,但存在“奖励作弊”问题。港赵恒爽团队提出 GDRO 后训练方法,引入组级奖励优化机制,提升模型表现、缓解作弊,还提高训练效率,有明显工程价值。

AI科技评论
算法论文7

拆解模型几项核心操作背后的数学与 Infra 优化逻辑

文章拆解模型核心操作(RMSNorm、Softmax、Causal Mask、Sampling)背后的数学与Infra优化逻辑。指出Infra优化是用数学等价变换或精度妥协换硬件利用率和推理速度,还介绍各操作原理、问题及优化方法。

腾讯技术工程
新闻资讯8

海淀105款模型背后:看这些AI玩家如何抢占内容生产制高点

在北京海淀文化沙龙上,家探讨AI如何重塑内容生产。海淀有105款备案模型,占全国五分之一。快手可灵月入超1亿,AI音乐模型让创作众化,投资人捕捉到AIGC创业潮,新的内容生产秩序正被改写。

量子位
新闻资讯7

「AI模型时代的CIO」云栖专场: AI实战者与落地破局者的坦白局

云栖会「AI模型时代的CIO」专场,探讨企业AI落地难题。虽搭上AI电梯是趋势,但企业落地有不确定性,如组织架构不匹配等。多位实战者分享经验,给出RIDE等解法,助企业破局。

阿里云开发者
开源动态7

20人团队提前实现DeepSeek构想,AI算力变天?直击模型算力成本痛点

国内20人玉盘AI团队推出SRDA全新计算架构方案,试图从硬件源头解决当前AI算力核心瓶颈。该架构有诸多创新设计,能应对模型训推痛点,与DeepSeek构想契合,或成模型专用架构分水岭。

新智元
算法论文8

高瓴-华为诺亚:语言模型智能体记忆机制的系列研究

中国人民学高瓴人工智能学院与华为诺亚方舟实验室聚焦语言模型智能体记忆能力,形成含综述论文、数据集和工具包的研究体系。探讨记忆概念、重要性、实现与评测方法,还构建评测榜单、实现工具包。

机器之心
算法论文7

苹果港终结自回归时代?7B扩散模型发布,AI写代码逻辑彻底颠覆!

苹果联合港开源扩散语言模型DiffuCoder,用扩散模型+强化学习策略,性能提升4.4%。研究还提出耦合梯度奖励策略优化方法,建立原生RL训练框架,探究了dLLM的生成机制等问题。

新智元
产品应用7

DeepSeek接入智慧小浪,「评论罗伯特」爆梗进化!背后模型全揭秘

新浪新闻推出AI辅助工具「智慧小浪」,接入DeepSeek深度思考能力,依托知微模型,能总结资讯要点、提供延伸阅读。微博「评论罗伯特」升级,更懂用户情绪、回复有深度。此外,微博还有博主AI助手等爆款应用。

新智元
产品应用8

美团提出全新多模态统一模型STAR,GenEval突破0.91,破解“理解-生成”零和困局

近日美团推出多模态统一模型 STAR,以“堆叠自回归架构 + 任务递进训练”实现理解与生成双重突破。它解决行业痛点,通过三核心设计统一能力,实验在多任务中表现顶尖,还给出后续探索方向。

机器之心