可控视觉生成模型」共找到 2794 篇相关文章

新闻资讯7

Cursor押注云端Agent!CEO 放话:审核AI代码是开发者最核心竞争力

Cursor CEO 称 AI 编程进入第三时代,智能体可少人工介入完成复杂任务,开发者角色转变。Cursor 团队超三分之一 PR 由云端智能体生成,不过这引发了开发者对代码审查、工作流、安全等问题的讨论。

InfoQ
算法论文8

登顶多模态推理榜MMMU!UCSD新方法超越GPT-5、Gemini

加州大学圣地亚哥分校团队开发的DreamPRM-1.5在MMMU测评榜夺冠,超越GPT-5、Gemini 2.5 Pro Deep-Think。它细化加权粒度到样本,有Instance Table和Instance Net架构,采用双层优化与生成式奖励模型。

新智元
产品应用8

面壁MiniCPM-V4.5新王炸!8B手机10FPS长视频秒懂,文档手写全能识别!

面壁上新最强端侧多模态模型MiniCPM-V 4.5,基于Qwen3 - 8B与SigLIP2 - 400M构建,总参数量8B。它视觉语言理解强、手机能跑,有高帧率视频理解等特点,还有多方面技术亮点。

CourseAI
开源动态8

世界模型评测的最大盲区,被这个新基准捅破了

过去一年,‘世界模型’成视频生成领域热词,厂商强调产品要模拟真实世界运行规律,但业界评测一直未能精准检验其‘物体恒存’的认知能力。为此,研究者提出新基准MemoBench,测试了主流模型,揭示其短板。

机器之心
算法论文8

加速近5倍!北大与字节团队提出BranchGRPO,用「树形分叉 + 剪枝」重塑扩散模型对齐

北京大学与字节团队提出 BranchGRPO 新型树形强化学习方法,通过在扩散反演中引入分叉与剪枝,解决扩散/流匹配模型人类偏好对齐难题。该方法在图像与视频生成任务中表现优异,迭代时间最高近 5 倍加速。

机器之心
开源动态8

41个榜单SOTA!智谱最新开源GLM-4.5V实测:看图猜地址、视频秒变代码

智谱基于GLM - 4.5打造的开源多模态视觉推理模型GLM - 4.5V,在42个公开榜单中41项夺得SOTA。其功能丰富,玩法升级,还为企业与开发者提供高性价比方案,是100B参数级SOTA标杆。

新智元
产品应用7

WAIC最强亮点:非Transformer离线AI大模型已大规模量产,大模型商业比我们想得更快

在WAIC上,RockAI推出非Transformer离线AI大模型Yan 2.0 Preview,有视觉感知跃升和自主学习能力两大提升。该公司走非Transformer路线,着重场景落地,通过“标杆战略”推动产品量产,未来构想构建“群体智能”世界。

AI科技评论
产品应用8

AI PPT,这次是真不用返工了

过去AI做PPT虽快但有“幻觉数据”和“拼凑式模板”问题,被认为是高估需求。如今讯飞智文Vision Agent出现,能生成专业PPT,还解决了美观、内容等问题,将AI PPT带入2.0阶段。

量子位
开源动态8

半个月暴涨23k+ Star,一行命令让任意软件 Agent-Native!

介绍开源项目`CLI-Anything`,它用CLI作AI Agent与软件桥梁,有全新思路。半个月Github涨23k+ Star,能一键生成CLI,对接真实后端,但也有依赖代码质量、不适闭源软件等局限。

开源先锋
推荐文章8

AI热点选品:当推荐系统遇上“热点”,我们需要一场变革

文章指出当下推荐系统追踪热点滞后,存在时效、解码、迭代困境。为此启动热点AI选品项目,构建自动化热点响应系统,经多环节处理输出优质候选集,还介绍成果、后续优化方向及AIGC图像生成方案。

阿里云开发者