「D2技术大会」共找到 3424 篇相关文章
本地运行OpenAI Whisper语音识别模型,Unity3d环境下高性能离线转写解决方案
这是为whisper.cpp提供的Unity3D绑定库,能在本地设备高性能运行OpenAI Whisper自动语音识别模型推理。支持多语言识别与翻译,有不同大小模型,可本地运行,还介绍了使用方法。
AI教母李飞飞空间智能开源大动作:上亿节点3D高斯场景塞进手机网页
AI教母李飞飞的空间智能公司World Labs开源3D高斯泼溅网络渲染器Spark 2.0,打破硬件与平台壁垒,将亿级渲染能力带到网页和移动端,解决Web端痛点,还采用三大核心技术系统及更多黑科技。
刚刚,李飞飞空间智能新成果震撼问世!3D世界生成进入「无限探索」时代
斯坦福大学教授李飞飞创业公司 World Labs 发布限量开放测试预览版空间智能模型 Marble。输入单张图片或文本提示,它就能生成可无限探索的 3D 世界,与谷歌 Genie 有显著区别,还支持导出高斯点云等。
2050大会 | 「AGI4Science·新生论坛——正在生长的科学地图 」嘉宾阵容全览!
2026年4月25日上午9点,2050大会将迎来“AGI4Science·新生论坛”专场。该论坛由王婷召集,以“三幕剧”展现AI for Science从理论到产业的图景,涵盖多领域,17位专家将探讨AI4S的生长与变革。
里程碑时刻!首个100B扩散语言模型来了,技术报告揭秘背后细节
蚂蚁集团与高校联合团队推出 LLaDA2.0 系列扩散语言模型,其中 LLaDA2.0 - flash 参数量达 100B。技术报告披露细节,其解决了 dLLM 做大做强难题,性能比肩 AR 模型,为扩散模型工业化带来转机。
超越AlphaFold 3!ProRNA3D搞定RNA蛋白互作,攻克癌症、病毒有了新武器
弗吉尼亚理工Debswapna Bhattacharya团队开源AI工具ProRNA3D - single,能仅靠单条蛋白质和RNA序列预测二者复合物三维结构,超越AlphaFold 3等工具,基于生物语言模型,有诸多应用价值,也有改进方向。
ECCV'26 | 为视频虚拟试衣解锁自由视角,TryOnCrafter玩转4D试衣代理
现有视频虚拟试衣方法受限于固定相机视角,难以满足用户自由观察需求。本文提出 TryOnCrafter 框架,定义可控相机视频虚拟试衣任务,引入可渲染 4D 试衣代理,支持多种下游应用,为虚拟试衣开辟新路径。
解密谷歌 NotebookLM 技术幕后【上】:知识如何被“转译”为 AI 对话式播客
NotebookLM是Google推出的AI知识工具,能将文档、网页等内容转化成笔记、播客、视频等。文章探秘其技术,解析AI音频播客与视频生成能力,还给出构建音频播客生成器的实践流程。
舍弃自回归,离散扩散语言模型如何演化?NUS综述解构技术图谱与应用前沿
本文介绍新加坡国立大学xML团队的论文,梳理离散扩散方向研究图谱,对比自回归局限与离散扩散优势,阐述数理基础、模型生态、训练与推理技术,还提及应用及未来方向,显示其对自回归范式的替代潜力。
会写剧本、能凹人设,还顺带站上领奖台,这数字人包“会”的
百度凭借剧本驱动多模协同的高拟真数字人技术打造数字人“老罗”直播带货,GMV达5500万+。该技术在2025年世界互联网大会乌镇峰会获领先科技奖。它让数字人协同多方面,已落地多行业提效显著。