「4D世界模型」共找到 8519 篇相关文章
全球排名前三,复旦自进化Harness Engineering让GPT‑5.4再涨7个点
2026 年以来,Harness Engineering 成业界热词。复旦大学等团队提出 Agentic Harness Engineering (AHE),可实现 Harness 自动优化。实验中,AHE 让 GPT - 5.4 分数提升,适配 GPT - 5.5 后排名全球第三,且有良好泛化能力。
对标GPT-4o和香蕉!浙大开源ContextGen:布局身份协同新SOTA
浙江大学ReLER团队开源ContextGen框架,攻克多实例图像生成中布局与身份协同控制难题。基于Diffusion Transformer架构,用双重注意力机制实现布局精准锚定与身份高保真隔离,在基准测试中超越开源SOTA模型,对标GPT - 4o等闭源系统。
央企怎么做超级智能体?对谈中电信天翼AI:自研模型为底座,自主规划是必须,能适应千行百业才行
中国电信天翼AI发布星辰超级智能体,获2025企业级AI Agent榜单央企第一。它依托自研“星辰大模型”,具备全模态、复杂推理等能力。访谈专家指出智能体可直接产出应用,落地需嵌入主业系统,电信持续迭代模型优化它。
李飞飞万字长文爆了!定义AI下一个十年
李飞飞新文指出AI下一个前沿是「空间智能」,揭秘其「世界模型」核心框架和三大核心支柱。构建具备空间智能的AI需世界模型,其应用涵盖创意、机器人、科学医疗等领域,有望提升人类生活。
ICCV 2025|降低扩散模型中的时空冗余,上交大EEdit实现免训练图像编辑加速
上海交通大学EPIC Lab团队提出EEdit框架,入选ICCV 2025。它是首个加速匹配流模型图像编辑框架,能兼容多种引导方案,免训练,速度较原始工作流快2.4倍,支持多类型编辑任务。
Alibaba力作:Ovis-U1 融合理解、生成与编辑,解锁无限可能
OpenAI 2025 年推出的 GPT - 4o 结合图像与语言能力,但引发视觉解码器设计及统一模型训练问题。Alibaba 力作 Ovis - U1 单一模型能完成理解、生成与编辑任务,介绍了其架构、训练过程和应用。
ICLR 2026 | 异常需要定义!中传团队提出开放世界视频异常检测新范式
现有视频异常检测(VAD)方法泛化能力不足,无法适应开放世界需求。中传吴晓雨团队在ICLR 2026发表论文,提出LaGoVAD模型,联合建模视频与异常定义,解决样本密度下降等问题,实验显示泛化性强。
AI生图大洗牌!流匹配架构颠覆传统,一个模型同时接受文本和图像输入
AI生图有新突破,新模型FLUX.1 Kontext用流匹配架构,与此前技术不同,能接受文本和图像输入。其来自Black Forest Labs,有编辑和生成能力,还具备4个特性,第三方测试也给出提示词使用技巧。
AI版盗梦空间?Claude竟能察觉到自己被注入概念了
Anthropic最新研究发现LLM有内省迹象,Claude能察觉概念注入。研究用概念注入测试,虽模型内省能力有限且不可靠,但能力强的Claude Opus 4和4.1表现好,未来内省或更复杂。
超实用提示词模板!AI科学家教你用协作提示词激发大模型潜力
文章由知名AI科学家Lance Eliot所写,指出主流大语言模型因训练机制变得‘短视’,缺乏深度协作能力。介绍协作提示词技术,能让AI成为主动引导者,并以测试展示效果,还说明了适用场景。