「跨场景迁移」共找到 2391 篇相关文章
横扫19项榜单!大晓机器人开源全球首创空间智能底座
大晓机器人联合多机构推出通用基础模型“ACE - Brain - 0”并全行业开源。它打破本体壁垒,在24个核心benchmark中19个获SOTA成绩,应用于机器狗,还提出新训练范式,统一四大能力,重新定义通用具身智能。
Adobe 新研究:不用再「喂」训练数据,VLM 靠和自己玩游戏变聪明
Adobe 等机构研究人员提出「Vision-Zero」,借鉴 AlphaGo 自迭代方式,设计让 VLM 自我学习框架。此框架以类似「谁是卧底」游戏训练,不依赖标注数据,在多任务超越有标注的 SOTA 方法。
比思维链准43%!逻辑脑+大模型直觉,推理可靠性大幅提升
中德研究团队发布成果,给大模型外挂「逻辑脑」,结合答案集编程与LLM,构建神经 - 符号框架,提升空间推理准确率,让AI能说清逻辑、跨任务迁移,迈向更可靠的通用推理。
谷歌Nano Banana全网刷屏,起底背后团队
谷歌开发者节目展示了Gemini 2.5 Flash Image模型,它能快速生成高质量图像、保持场景一致。文中起底背后团队成员,还介绍模型技术亮点、与Imagen对比及未来能力展望。
Omni-Effects:首个统一多特效生成框架
Omni-Effects是面向多样化定制视觉特效生成的统一框架,结合纯提示词驱动与空间感知提示,可精确控制特效位置。构建Omni - VFX数据集验证其有效性,在复杂场景有高鲁棒性。
紫东太初开源视觉神经增强方法,即插即用终结多模态幻觉 | ACL 2025
中科院自动化所等团队提出VHR方案,通过“视觉神经增强”机制放大模型视觉关键注意力头输出,降低幻觉现象。此前主流方法多作用于最终输出阶段,VHR深入干预内部机制,还介绍了SSL语义引导方法。
Feed-Forward 3D综述:三维视觉如何「一步到位」
这篇由12所机构联合撰写的综述论文,总结2021 - 2025年间数百项创新工作,建立Feed - Forward 3D方法谱系与时间线,介绍五大技术分支、应用场景、评测指标与结果,还指出未来挑战与方向。
2025,大模型文档解析(OCR)年终盘点
2025年6月以来文档解析方法快速增长,有10余种。按“技术路线 + 工程形态”可归为4大类:传统级联流水线、轻量多模态两段式、通用多模态大模型一段式、轻量多模态一段式,各有优劣,4条路线覆盖所有OCR落地场景。
拼交付、主动找活干,3 月我们推荐这 18 款 Agent 产品
3月是AI产品发布密集期,出现一批主动干活的Agent产品。文章介绍18款产品,如Claude系列升级为个人AI操作系统,OpenClaw生态涌现多种商业形态,还有垂直场景Agent及上下文感知等产品。
给 iPhone 装个“最强本地大脑”:Google 开源模型 Gemma 4
Google 4 月初发布开源模型 Gemma 4,可离线运行在 Google AI Edge Gallery 上。它在多项基准表现出色,采用 Apache 2.0 协议,开发者可集成到 App。还介绍了在 iPhone 离线使用方法及适用场景。