「样本合成」共找到 389 篇相关文章
SceneSplat: 基于3DGS的场景理解和视觉语言预训练,让3D高斯「听懂人话」的一跃
文章引入 SceneSplat,首个在 3DGS 上原生运行的端到端大规模 3D 室内场景理解方法,提出自监督学习方案,构建发布 SceneSplat - 7K 数据集,在多个实验中达 SOTA 效果。
腾讯开源Stand-In!轻量级身份保留视频生成新突破
生成符合指定身份的高保真视频挑战大,现有方法依赖大参数且兼容性不足。腾讯开源轻量级、即插即用的Stand - In框架,在身份保留文本生成视频任务中性能先进,兼容性强,有广阔应用潜力。
全能高手&科学明星,上海AI实验室开源发布『书生』科学多模态大模型Intern-S1 | WAIC 2025
7月26日,上海AI实验室在WAIC 2025上发布并开源『书生』科学多模态大模型Intern-S1。它首创‘跨模态科学解析引擎’,在多学科专业任务上超越顶尖闭源模型,多模态综合能力领先主流开源模型。
Kimi K2技术报告正式发布:“保姆级”深度解析,一文读懂万亿参数智能体的所有秘密
Kimi K2技术报告发布,Moonshot团队用万亿+参数稀疏MoE架构等打造接近Claude - Opus的通用大模型。围绕训练稳定性等改进,有预训练、架构设计等多方面创新,为智能体领域提供可行路径。
用动作分块突破RL极限,伯克利引入模仿学习,超越离线/在线SOTA
如今强化学习在多领域成果显著,但在长跨度、稀疏奖励任务中表现欠佳。加州大学伯克利分校研究者提出Q - chunking方法,将动作分块引入基于时序差分的强化学习,解决探索效率和值传播问题,实验表现优异。
碾压DeepSeek V3!开源AI Agent专属模型,1万亿参数、工具使用能力超强
国内大模型平台月之暗面开源了模型Kimi - K2,这是混合专家模型,总参数1万亿。它针对AI Agent优化,工具使用能力强。测试显示其性能碾压DeepSeek V3等模型,训练流程还有独特技术创新。
开源端到端语音大模型:直接从原始音频输入,生成语音输出
目前大模型大多只能输出文本,人机音频交互不顺畅。Step - Audio团队开源端到端语音大模型Step - Audio - AQAA,能直接听懂音频问题并合成语音回答,介绍了其架构和各核心模块。
用大模型检测工业品异常,复旦腾讯优图新算法入选CVPR 2025
AI模型用于工业异常检测获新SOTA,相关论文中稿CVPR 2025。复旦大学、腾讯优图实验室等机构研究人员设计基于扩散模型的少样本异常图像生成新模型DualAnoDiff,实验显示其性能更优。
效果逼真到让人窒息!开源Ctrl-Crash模拟车辆事故
近年来视频扩散技术在生成车辆碰撞真实场景时面临挑战,因驾驶数据集中事故样本稀缺。Mila团队提出Ctrl - Crash可控碰撞视频生成模型,支持反事实场景生成,但也存在一些局限。
辛顿、杨立昆等 AI 先驱都源自信号处理——对话 IEEE 首位华人主席、美国双院院士刘国瑞 | 万有引力
本文是对IEEE首位华人主席刘国瑞的访谈。他分享了科研、创业经历,谈到AI先驱多源自信号处理,鼓励年轻人追梦,还探讨了科研模式、合成数据、AI应用及未来生活图景等话题。