「多模态控制」共找到 1359 篇相关文章
下一站AI创业主线:别卷模型了,把这件事干成才重要
在AGI Playground 2025上,极客公园张鹏与三位投资人探讨Agent时代投资。他们认为AI创业进入「拼交付」时代,多模态短期影响被高估、长期潜力被低估,通用Agent是巨头之争,垂直Agent是创业机会,还会催生新基础设施,付费模式向按结果付费演变。
谷歌新研究:大模型“吵架”有利于提升推理质量
谷歌新研究发现高级推理模型自发进化出'思想社会',研究人员用LLM - as - judge方法识别出多个虚拟人格。还找到控制现象的'开关',实验表明教AI'吵架'更有效,其'社交技能'通用,给开发者带来新启示。
开源项目捐给基金会后又往回要,维护 7 年出钱出力却被告上法庭?网友:捐了代码想收回去靠它赚钱,太无耻!
云原生计算基金会 (CNCF) 与开源消息系统 NATS 背后的 Synadia 公司就 NATS 项目的商标、域名和 GitHub 存储库控制权产生纠纷。Synadia 曾将项目捐赠给 CNCF,如今想“撤回”并变更许可证,双方各执一词,最终达成 Synadia 同意 CNCF 控制相关资产的协议。
2025,大模型文档解析(OCR)年终盘点
2025年6月以来文档解析方法快速增长,有10余种。按“技术路线 + 工程形态”可归为4大类:传统级联流水线、轻量多模态两段式、通用多模态大模型一段式、轻量多模态一段式,各有优劣,4条路线覆盖所有OCR落地场景。
写2000字提示词,不如先一键生成3D白模!AI视频创作进入“预演时代”
随着AI模型能力增强,科班人士利用其专业能力在AI视频创作赛道优势明显。updream预演台将影视行业预演工作流引入创作画布,解决了AI视频生成中‘拍什么’和‘怎么拍’的问题,虽有局限但意义重大。
Sora没做到的,LongVie框架给解决了,超长视频生成SOTA
视频生成近年进步大,但生成超1分钟高质量长视频仍难。上海人工智能实验室等机构提出LongVie框架,解决时序不一致和视觉退化问题,还推出评测基准LongVGenBench,该框架在多项指标达SOTA。
承包你的品牌营销物料|谷歌再发重磅 AI 设计产品
谷歌实验室发布AI设计产品Pomelli,专注帮企业低成本生成符合品牌调性的营销物料。它能提取官网品牌元素创建DNA卡片,依此生成设计稿,还能微调细节。不过,它依赖官网信息,存在美学单调等问题。
谷歌Nano Banana全网刷屏,起底背后团队
谷歌开发者节目展示了Gemini 2.5 Flash Image模型,它能快速生成高质量图像、保持场景一致。文中起底背后团队成员,还介绍模型技术亮点、与Imagen对比及未来能力展望。
1/8成本比肩Claude 3.7,Mistral Medium 3来了
“欧洲OpenAI”Mistral AI发布多模态新模型Mistral Medium 3,主打编程和多模态理解,成本仅Claude 3.7的1/8,性能达其90%,API已上线,还推出企业聊天机器人服务,引发网友不同看法。
Light-X来了!全球首个「镜头×光照」双控4D视频生成框架,单目视频秒变电影级
新加坡南洋理工大学等科研机构联合推出Light - X,全球首个「镜头×光照」双控4D视频生成框架。它解耦相机与光照,在扩散模型中融合,还构建Light - Syn数据管线,实验显示其效果显著优于现有方法。