三维场景生成」共找到 3827 篇相关文章

算法论文8

RL加持的3D生成时代来了!首个「R1 式」文本到3D推理大模型AR3D-R1登场

强化学习首次被系统性拓展到文本到3D生成领域,上海人工智能实验室等机构研究者提出首个强化学习增强的文本到3D自回归模型AR3D - R1,还提出Hi - GRPO范式和MME - 3DR基准,实验显示其性能优异。

机器之心
开源动态8

不看后悔!GitHub 开源 MultiTalk .8k star 强大的人语音+图像绑定项目

MultiTalk 是 MeiGen‑AI 开发的开源框架,可从音频、图片和提示语生成多人对话视频。它解决传统视频制作痛点,功能亮点多,技术优势明显,应用场景广,与同类项目对比表现突出。

小华同学ai
算法论文8

它来了!Context Engineering 2.0

SJTU、SII和GAIR新作《Context Engineering 2.0:The Context of Context Engineering》探讨上下文工程,回溯其30年历史,给出形式化定义,提出采集 - 管理 - 使用三维设计范式,还介绍了应用场景

PaperAgent
新闻资讯7

大模型年中报告:Anthropic 市场份额超 OpenAI,开源模型企业采用率下降

本文基于年中报告指出,当前模型API支出翻倍,企业重心转向模型推理。Anthropic市场份额超OpenAI,开源模型企业采用率下降。代码生成成热门场景,企业换模型重性能,AI支出从训练转推理。

Founder Park
开源动态8

狂揽20.2k星!还在傻傻的写SQL吗,那你就完了!这款开源项目,让数据分析像聊天一样简单?再见吧SQL

开源项目PandasAI让数据分析像聊天一样简单,由Sinaptik AI团队打造,将ChatGPT级自然语言处理能力注入Pandas。它有对话式分析、智能图表生成等亮点,适用于多场景,还给出使用步骤及与同类工具对比。

小华同学ai
开源动态8

轻量级语音模型Vui开源,支持本地部署,笑声停顿全拟真,4万小时练出人类对话感!

近日,Fluxions - AI团队在GitHub开源轻量级语音模型Vui,可设备端运行。它能精准模拟语气词、笑声等,有三款模型,适用于语音助手、播客生成场景,解决了传统模型的痛点。

开源星探
产品应用7

AI视频运镜玄学已破!告别无限抽卡,3D预演台直接封神

用AI做视频常遇运镜、人物走位等问题,因文生视频系统缺空间锚定能力。updream在8月17日上线「预演台」功能,通过传参考图自动生成3D白模场景,实测显示其显著减少「抽卡」次数。

新智元
算法论文8

只看图片就能学会压缩Token!浙大&阿里新框架多轮VQA压缩率90%,精度不掉|CVPR 2026

多轮视觉问答成LVLM推理效率“照妖镜”,现有压缩方法在多轮场景翻车。浙大宋明黎教授团队与阿里联合提出MetaCompress框架,可根据图像生成最优压缩映射,实验验证其效果优,能平衡压缩率与精度。

量子位
开源动态7

夯,还真的很不错,8.2k Star scroll-world,太丝滑~~~~

许多官网滚动特效不佳,scroll - world 让滚动驱动无切镜的品牌旅程。它通过生成镜头链、对齐接缝实现沉浸体验,还给出适用场景和接入方式,虽非零成本但复用了经验。

小华同学ai
产品应用7

能帮你做 Live Photo 了!藏师傅社交卡片 Skill 重磅更新

藏师傅社交卡片 Skill 重磅更新,新增 Live Photo 生成和编辑能力,可处理产品录屏等素材。介绍了能做的卡片类型、使用方法、适用场景,还提及制作细节及 Live Photo 的价值和安装更新方式。

歸藏的AI工具箱