「3D人体生成」共找到 3848 篇相关文章
开源 AI 文档生成器!给代码库做个CT扫描,一键生成交互式Wiki文档!
介绍开源工具DeepWiki-Open,它由AsyncFuncAI开发,能将GitHub或GitLab仓库一键转为交互式Wiki,基于多种技术实现代码分析和自动化文档生成,解决开发者理解复杂代码库的痛点,还给出快速上手步骤和适用人群等。
原生理解生成统一:商汤开源SenseNova U1,用统一架构终结「缝合怪」多模态
商汤开源日日新 SenseNova U1 系列原生理解生成统一模型,采用 NEO-unify 架构,只需 8B 小参数就能实现很多商业闭源模型效果。在多测评维度性能领先,还能实现连续性图文创作输出,解决理解与生成断层问题。
跳出英伟达生态:OpenAI 发布新编程模型 GPT-5.3-Codex-Spark,速度达 1000 token每秒
OpenAI 发布新编程模型 GPT-5.3-Codex-Spark,跑在 Cerebras 晶圆级芯片上,速度达每秒超 1000 个 token,比传统 GPU 推理快约 15 倍,这是其跳出英伟达生态的里程碑。
还在为拍视频头疼?AI 一键生成短视频,这工具也太香了吧!
文章介绍开源工具 Pixelle-Video,它能让视频创作变得简单。输入主题,它可自动撰写文案、生成配图、合成语音、添加音乐并合成视频,还支持多种功能和大模型,有多种使用和付费方案。
用短视频成本生成长视频,字节Seed新注意力机制让计算量降低85%
字节Seed与斯坦福等机构推出新模型,其新注意力机制MoC能让长视频生成计算量降低85%,质量不减且保持连贯性。团队将视频生成定义为上下文检索任务,提出MoC机制并阐述实现方法。
推理时间减少70%!前馈3DGS「压缩神器」来了,浙大Monash联合出品
在AR、VR等领域,3DGS是新视角合成(NVS)领域备受关注的技术方案。现有前馈3DGS模型存在编码器容量有限等问题,ZIP Lab和Monash团队引入信息瓶颈原理,推出轻量级模块ZPressor,有效解决信息过载难题。
比NotebookLM更好的「开源播客」,可根据多模态内容生成30分钟以上播客音频。
Podcastfy是开源Python工具,能把文本、图片等多模态内容,借生成式AI转化为播客。它支持自定义,适配多种语言和文本转语音模型,能生成2 - 5分钟或30分钟以上的播客,使用体验比NotebookLM好。
深度讨论 Gemini 3 :Google 王者回归,LLM 新一轮排位赛猜想|Best Ideas
近期,OpenAI、Google、Anthropic 先后发布新模型,引发大模型竞赛。本文聚焦 Google 发布的 Gemini 3,从算力、数据、架构等维度剖析其强大原因,探讨大模型竞争新格局,还涉及多模态、硬件、商业化及产品形态等方面。
ICCV 2025 | SeaS: 工业异常生成+正常合成+精准掩码大一统框架,指标全面碾压SOTA
华中科技大学慢工团队提出少样本工业生成模型SeaS,依托U-Net,只需1 - 3张训练样本,单模型同步实现多样异常生成、正常产品合成及精确异常掩码标注,突破现有方法局限,在主流数据集上超越SOTA。
Qwen3深夜开源新系列:文本表征模型,3种尺寸可选,超越商业API拿下SOTA
Qwen3深夜上新Embedding系列,专为文本表征等任务设计,在Qwen3基础模型上训练,有0.6B/4B/8B三种尺寸,8B版本在MTEB榜单排第一,性能超商业API,已在多平台开源。