「多模态代码生成」共找到 4215 篇相关文章
150%训练效率提升:感知检测小模型训练优化方法
文章基于业务实践,总结感知检测小模型在不同算力卡上的训练方法,为智能驾驶场景提供借鉴。介绍测试环境、技术架构,分析环境依赖冲突、源代码适配等问题并给出解决方法,还提及性能优化及测试结果。此外还介绍用 RAGFlow 构建私有知识问答应用。
行业新突破:行为基础模型可实现高效的人形机器人全身控制
该综述聚焦行为基础模型(BFM)在人形机器人全身控制中的应用,梳理进展并分类算法,介绍应用与限制,还探讨未来研究机会与风险,有望引导该领域研究者和从业者。
简单了解下CUDA Green Context
文章基于Flashinfer实现介绍CUDA Green Context,它在CUDA 12.0+引入,能实现资源隔离、降低多线程性能损失、提高GPU使用率。还给出使用方法及代码示例,不过测试性能未达预期,需关注后续发展。
B站发布最强零样本TTS,IndexTTS2情感可控、时长精准
在大规模TTS系统中,自回归模型难精准控制语音时长。Bilibili推出IndexTTS2,支持两种生成模式,实现情感表达与音色解耦,引入GPT潜在表示,设计‘软指令’机制,降低情绪控制门槛。
周杰伦发的1400万人点赞的AI视频,是怎么做出来的?
周杰伦抖音首条1400多万点赞的AI视频,将其人生节点与专辑串联,有史诗叙事感。文章介绍用AI视频首尾帧功能制作视频的方法,还举例岳云鹏、《甄嬛传》、科比等,称AI能倒转时空。
阿里达摩院开源多模态医学大模型—灵枢
大模型在医疗领域应用有医疗知识覆盖不足、幻觉风险高、推理能力欠缺三大难题。阿里达摩院开源统一多模态医学大模型灵枢,介绍其数据体系、清洗流程及四阶段强化训练方法。
研究显示:AI 并没有提升编程效率,它反而让你变慢了19%
METR研究显示,16位资深开发者在真实项目测试中,使用AI工具效率降低19%。分析发现,编写提示词、等待响应等耗时多,保留代码仅44%。研究指出多因素致效率低,网友看法不一。
“10x Cursor”开发体验, Claude Code 如何带来 AI Coding 的 L4 时刻?|Best Ideas
文章聚焦 Claude Code,探讨其在 AI Coding 领域的表现。开发者因成本低、效率高、异步开发等优势迁移至此。虽其 CLI 形态爆火,但 GUI 才是未来。Claude Code 达 L4 级别,也指出当前 AI coding 产品不足与未来机会。
无损加速视觉语言模型推理!轻松剪掉视觉冗余Token|腾讯AI Lab
多图像、长视频让大型视觉语言模型推理成本暴涨,成算力瓶颈。腾讯AI Lab联合CMU提出VScan,通过两阶段视觉token筛选机制,在几乎不损性能的前提下实现推理加速,且已在GitHub开源。
智源新出OmniGen2开源神器,一键解锁AI绘图「哆啦 A 梦」任意门
2024年9月智源研究院发布统一图像生成模型OmniGen,获社区好评。近期OmniGen升级为OmniGen2,增强多方面能力且全面开源。它采用新架构与策略,有反思机制,玩法丰富,还推出新基准优化部署。