「中文字生成」共找到 4541 篇相关文章
关于CUTLASS Grouped GEMM中Alignment参数的分析
文章围绕CUTLASS Grouped GEMM的Alignment参数展开。介绍其含义与自然对齐有关,既代表访问粒度也指明地址对齐要求。针对CUTLASS 2.x和3.x API分别阐述设置Alignment的方法及原理,还给出编译期推导代码示例。
500万视频数据集+全新评测框架!北大开源主体一致性视频生成领域新基建OpenS2V-Nexus,生成视频 「像」 又 「自然」
北大团队推出开源套件OpenS2V - Nexus,含全球首个S2V细粒度评测基准OpenS2V - Eval和500万条高质量人物文本视频三元组数据集OpenS2V - 5M,还评测18个S2V模型,揭示主流模型能力差距。
演讲生成黑科技,PresentAgent从文本到演讲视频
联合团队提出 PresentAgent,能将长篇文档转化为带解说演示视频。采用模块化流程,还引入 PresentEval 评估框架。实验显示其接近人类表现,优于现有方案,展现了多模态智能体潜力。
震撼!人类第一张在太空生成的图片曝光
人类首张太空生成图片曝光,共绩科技与星测未来两家清华系企业携手开启「天地同算」时代。前者解决算力调度难题,后者让太空有算力可用,未来太空或成分布式超级计算机。
第十一章 Deep Agents 实战——数据分析与报告生成
本章介绍构建营销内容 Agent,能分析产品数据、生成营销文案等。核心技术有结构化输出、多 Skill 水平组合、模拟数据分析。还对比传统营销与 Agent 流程,展示结构化输出优势及数据驱动决策方法。
从多模态大模型中「拆」出音频向量模型
Google 发布原生多模态向量模型 Gemini Embedding 2,推动 Omni Embedding 发展。Jina AI 团队分享从多模态大模型中「拆」出音频向量模型的经验,介绍架构、训练数据,对比四种做法,还提及评测、应用场景及结论。
OpenVision 2:大道至简的生成式预训练视觉编码器
多模态大模型浪潮中,视觉模块是关键。此前OpenVision训练管线复杂,成本高。研究者提出OpenVision 2,移除文本编码器与对比学习,引入随机丢弃视觉token技巧,性能佳且效率高,挑战了对比学习范式。
深度学习中Batch Size对训练过程如何影响?
文章分析深度学习中batch size对训练过程的影响,探讨超大batch优缺点及应对方法。用面试、通俗、科学三种方式解答问题,还通过MNIST实验,从迭代速度、梯度平滑程度、收敛速度等指标对比不同batch size情况。
张小珺对话OpenAI姚顺雨:生成新世界的系统
OpenAI研究员姚顺雨在播客访谈中分享诸多新颖观点。他认为创业公司机会在设计新交互方式,未来或产生超越ChatGPT的超级应用;还指出语言是实现泛化的工具,强化学习有泛化趋势,智能边界由不同超级应用共同定义。
揭秘!RLVR/GRPO中那些长期被忽略的关键缺陷
近年来大模型任务突破离不开RLVR关键技术,许多RLVR方法会进行组内优势估计,北航等最新工作揭示其存在系统性偏差,困难题优势被低估,简单题被高估。这会影响训练,论文提出校正算法。