「仿真合成数据」共找到 2638 篇相关文章
CVPR 2025 | SketchVideo让手绘动起来,视频生成进入线稿时代
中国科学院大学等团队提出基于线稿的可控视频生成和编辑方法SketchVideo,发表于CVPR 2025。它基于预训练模型添加线稿控制网络,解决现有视频生成模型可控性等问题,实现高质量视频生成与编辑。
3200+ Cursor 用户被恶意“劫持”!贪图“便宜API”却惨遭收割, AI 开发者们要小心了
近日,网络安全研究人员标记出三个恶意npm软件包,攻击Cursor编辑器macOS版用户,下载超3200次。这些包伪装成便宜API工具窃取凭据、替换代码,还凸显供应链威胁,Socket还发现另两个恶意包。
GitHub Issues 大改造:用缓存和预取,让页面打开快了数倍
GitHub 重新设计 GitHub Issues 导航架构,通过客户端缓存、预测性预取等机制,提升导航性能,使即时导航体验比例从 4%增至 22%,解决大型 Web 应用常见的延迟问题。
拆解大模型几项核心操作背后的数学与 Infra 优化逻辑
文章拆解大模型核心操作(RMSNorm、Softmax、Causal Mask、Sampling)背后的数学与Infra优化逻辑。指出Infra优化是用数学等价变换或精度妥协换硬件利用率和推理速度,还介绍各操作原理、问题及优化方法。
不用人类手写训练框架了!AI自己写代码,训出1B端侧「小钢炮」
5月25日,面壁开源端侧文本基座大模型MiniCPM5 - 1B,主打低成本部署等。它由AI编写的ForgeTrain框架参与预训练,效果与英伟达Megatron对齐且速度快10%。该模型在榜单表现优,应用边界广,部署门槛低。
刚刚,DeepSeek全新多模态技术开源!
DeepSeek联合北大、清华开源多模态技术及论文,提出“视觉基元推理”框架,解决MLLM指代鸿沟问题。基于DeepSeek - V4 - Flash构建的模型,性能比肩GPT - 5.4等。论文还介绍架构、训练流程等。
群核十五年:一家“被AI重新定价”的公司上市了|甲子光年
群核科技15年后在港上市,其以“酷家乐”在家居设计软件领域渗透高。它正从3D工具商迈向空间智能服务商,早期被低估,如今随AI发展,早期投入成为生产力,转型向机器收费。
统一VLA范式!港科大开源StarVLA乐高式架构,复现成本大幅降低
当前具身智能的VLA赛道陷入「碎片化」泥潭,方法难对比、复现成本高。港科大开源StarVLA,提出「乐高式」统一架构,构建模块化开源底座,实现双向模块化,还支持多种训练范式,打通Sim2Real。
AI让全人类思维越来越雷同!南加大研究实锤:认知多样性正在被抹平
南加州大学论文指出,AI正让全人类想法和表达同质化,体现在语言、视角和推理三方面。原因包括训练数据有偏差、训练目标求稳、人们过度依赖。研究人员虽在想办法,但效果有限,呼吁勿无节制依赖。
CVPR Highlight|让无人机学会自己认路+锁位目标,国防科大给出一套新解法
国防科技大学 SAW Lab 团队联合多高校推出无人机实时地理定位系统「PiLoT」,首次仅靠单目 RGB 序列在 GNSS 拒止环境完成无人机及目标定位,性能达先进水平,成果被 CVPR 2026 接收。