「实时流扩散」共找到 706 篇相关文章
MIT给微型机器人做了颗芯片,功耗仅6毫瓦,能实时3D建图
麻省理工学院研究团队开发出名为 Gleanmer 的微型芯片,功耗仅 6 毫瓦,能实时生成三维占据地图。它解决了机器人导航核心问题,通过多项优化提升性能,或让小设备拥有空间理解能力。
8.6K star!!实时翻译、离线使用、支持50+语言,这个免费开源项目牛皮!
介绍开源项目RTranslator,它为Android平台实时翻译应用,用Meta的NLLB模型与OpenAI Whisper技术,本地处理保障质量与隐私。有双模式对话等功能,在Github获8.6K star。
NeurIPS 2025 Best Paper | 扩散模型不为人知的“时间差”:为什么先学会创作,后学会抄袭?
深度学习中,扩散模型能生成新图像且抗过拟合。巴黎高师和博科尼大学研究团队论文指出,这源于隐含的动力学正则化,训练分两阶段,数据量增加会拉开‘泛化窗口’,还给出数学解释。
“设计师的 Cursor”!拖拖拽拽就能做前端,AI 实时生成代码,代码设计双向同步!
Onlook是号称‘设计师的Cursor’的开源工具,可让用户在浏览器可视化构建前端界面,通过AI驱动双向绑定实现设计与代码实时同步,还具备多项核心功能,适用于多种场景,解决设计与开发痛点。
大神李沐回归B站「做了个实时数字人」,直言「水平吊打我自己」
大神李沐回归B站,展示用创业公司BosonAI的Higgs Avatar v1模型做的实时数字人,称其水平“吊打自己”。该模型能带来接近真人的临场感,操作简单,有四大核心优势,已进入内测。
12秒生成1万token!谷歌推出文本「扩散模型」Gemini Diffusion,研究员:演示都得降速看
谷歌将图像生成常用的“扩散技术”引入语言模型,推出Gemini Diffusion,12秒能生成1万tokens,速度比Gemini 2.0 Flash - Lite更快。它通过逐步优化噪声学习生成输出,目前是实验性演示,可申请体验。
代码库的AI觉醒!GitMCP开源神器:实时文档中心秒级搭建,终结代码幻觉!
AI助手处理项目文档常“幻觉”频发,GitMCP这款开源工具通过MCP将GitHub仓库转变为实时文档中心,让AI直接访问最新文档和代码,消除“代码幻觉”。它功能强大,配置简单,应用场景广泛。
如何做到在手机上实时跑3D真人数字人?MNN-TaoAvatar开源了!
阿里巴巴淘宝Meta技术团队研发的TaoAvatar技术,能在手机或XR设备实现3D数字人实时渲染与AI对话。今日开源MNN - TaoAvatar应用,可在手机运行,对比主流方案更高效便捷,还介绍其优势、技术及使用说明。
ICCV 2025|降低扩散模型中的时空冗余,上交大EEdit实现免训练图像编辑加速
上海交通大学EPIC Lab团队提出EEdit框架,入选ICCV 2025。它是首个加速匹配流模型图像编辑框架,能兼容多种引导方案,免训练,速度较原始工作流快2.4倍,支持多类型编辑任务。
视频扩散模型新突破!清华腾讯联合实现高保真3D生成,告别多视图依赖
清华大学联合腾讯提出Scene Splatter,基于视频扩散模型,从动量视角引导其生成满足三维一致性的视频片段,提升三维场景生成效果,解决了传统方法在单张图片重建三维场景的难题。