「空间一致性」共找到 643 篇相关文章
用更一致的轨迹、更少的解码步数「驯服」掩码扩散语言模型,扩散语言模型的推理性能和效率大幅提升
扩散大语言模型发展迅猛,或成下一代大语言模型基础范式有力竞争者。复旦大学等团队发布论文,提出高效解码策略与强化学习训练组合,解决MDLM解码和训练问题,提升推理性能与效率。
字节发布通用游戏智能体!5000亿token训练,用鼠标键盘吊打GPT-5!
字节seed团队打造通用游戏智能体Game-TARS,基于键盘—鼠标动作空间训练,用超5000亿标注量级数据,结合新技术提升扩展性和泛化性,在多类游戏任务中表现超越GPT - 5等模型。
美团重磅开源!13.6B通用视频生成大模型,能文生视频、图生视频、还能续写!
AI视频生成竞争激烈,美团团队在GitHub开源通用视频生成模型LongCat-Video,参数量13.6B,能文生视频、图生视频、视频续写,几分钟生成720p、30fps长视频,有核心优势,还介绍了安装部署等内容。
具身智能学界业界思想「惊人的统一」?美团在IROS开了个学术年会
美团在IROS举办学术年会,展示了在具身智能与零售服务结合方面的愿景与成果,如无人机配送初具规模。多位学界和业界大咖参会并发表见解,对具身智能发展方向观点惊人统一。
人人都能炼专属Agent,上海交大开源端侧Agent全栈工具链,真实场景性能超GPT-5!
上海交大开源端侧Agent全栈工具链MobiAgent,将构建手机Agent全流程开放。它在真实场景性能超GPT - 5,还设计“潜记忆加速器”,通过三步养成Agent,评测表现出色,降低移动智能体开发门槛。
00后以1.1亿美金「掀桌」,硅谷AI将书写影视新传奇 终结制片旧时代
00后Cecilia Shen创立的Cybever转型为AI原生影视工作室Utopai Studios,首年获1.1亿美元收入。其技术经四个阶段进步,能生成高质量3D虚拟环境,还带来两部大剧,有望改变影视行业格局。
Google官方发布nano banana使用指南
Google官方发布nano banana使用指南,介绍其核心能力,如角色一致性、精确局部编辑等,还给出写提示词的6要素、5种实用技巧,同时指出模型存在风格化不一致、文字渲染易出错等问题。
Cloudflare 如何将 Quicksilver 迁移到多级缓存并处理数十亿个请求
Cloudflare 工程团队分享将全局键值存储 Quicksilver 过渡到分层缓存架构的故事。从 V1 到 V2 迁移,采用多级缓存策略,解决存储、一致性等问题,提升性能,多数请求可在短时间内响应。
ACL 2025|为什么你设计的 Prompt 会成功?新理论揭示大模型 Prompt 设计的奥秘与效能
英属哥伦比亚大学等团队剖析Prompt在LLM的CoT推理中调控模型内部信息流,构建量化Prompt搜索空间复杂度理论框架。研究解释提示有效的原因,提供设计高效提示词思路,实验验证理论框架。
一张俯视图,竟然能生成完整3D小镇?
获取高质量3D场景成本高、耗时长,现有3D生成模型扩展到完整场景生成时问题多。加州大学提出无需训练的3DTown框架,能从单张俯视图合成真实连贯3D场景,虽有挑战但表现优于基线方法。