「文本表征模型」共找到 7955 篇相关文章
谢赛宁团队新作:不用提示词精准实现3D画面控制
谢赛宁团队新发布的Blender Fusion框架,结合图形工具 (Blender) 与扩散模型,让视觉合成不再仅依赖文本提示,实现精准画面控制。其核心是对现有技术高效组合,还透露两项训练技巧提升泛化性。
实测惊艳全球的Veo3!音画同步无敌,贵是有原因的
谷歌开发者大会推出的Veo3模型,具备强大文本和图像转视频能力,首次实现视频与音频同步生成。实测中,它生成的视频音画效果惊艳,但也有翻车情况,谷歌还给出提示词编写指南。
三位AI殿堂级人物罕见同框:LeCun、李飞飞、谢赛宁团队用空间超感知让AI像人一样理解三维世界
谢赛宁团队联合杨立昆、李飞飞发布Cambrian - S研究,提出空间超感知概念,指出现有AI视频理解或被高估,推出VSI - SUPER基准测试,虽Cambrian - S模型有提升但仍有局限,预测性感知或成新范式。
CVPR 2025 多模态大一统:斯坦福 x 复旦提出符号主义建模生成式任务
来自多机构研究团队提出基于符号化表征的生成任务描述框架,将符号化思维引入生成任务建模。实验证明,该框架在跨模态生成任务中表现出色,为推进生成式人工智能能力提供了成本效益高且可扩展的基础。
AI打通第一/第三人称视觉,跨视角视觉理解新SOTA|ICCV 2025 Highlight
INSAIT、复旦大学等联合提出ObjectRelator框架,让AI精准匹配不同视角下同一物体,实现跨视角统一表征与理解。它在Ego转Exo和Exo转Ego任务上超基线模型,已被ICCV 2025接收,代码开源。
单向VLM变双向!人大斯坦福等提出MoCa框架:双向多模态编码器
人大、斯坦福等机构提出MoCa框架,将单向视觉语言模型转化为双向多模态嵌入模型。它通过持续预训练和异构对比微调,解决传统模型局限,在多模态基准测试中表现优异,尤其小规模模型性能突出。
小说一键转有声剧!豆包语音团队提出「AI多人有声剧」方案,沉浸感拉满了
豆包语音团队发布「AI 多人有声剧」自动化方案,基于多角色 Seed - TTS - 2.0 模型,实现从小说文本到有声剧成品端到端 AI 制作,成本和周期大降,首批有声剧已在番茄小说 App 上线。
LLM加速利器LMCache,极大降低GPU资源消耗
LMCache是大语言模型服务引擎扩展组件,能降低首次响应延迟、提升吞吐量,适用于长上下文场景。它将KV缓存存于多级存储,跨服务实例复用任意重复文本的KV缓存,节省GPU算力,与vLLM结合优化显著。
华为GTS让Agent学会「看着网络排障」,双防火墙难题几乎全拿下
本文介绍华为GTS算法团队针对大模型Agent网络排障遇到的「拓扑失忆」痛点,提出NetCanvas方案,通过可交互视觉拓扑实现认知卸载,大幅提升复杂网络排障的准确率和效率。
Cursor就是最强知识库应用,没有之一
作者认为最好用的知识库应用是Cursor,它有RAG能力,能处理代码和纯文本,可创建修改文档,具备搜索能力且会及时支持先进模型。作者还分享用Cursor配合文档工作的规则及使用示例。