「视觉-语言生成」共找到 3493 篇相关文章
加速近5倍!北大与字节团队提出BranchGRPO,用「树形分叉 + 剪枝」重塑扩散模型对齐
北京大学与字节团队提出 BranchGRPO 新型树形强化学习方法,通过在扩散反演中引入分叉与剪枝,解决扩散/流匹配模型人类偏好对齐难题。该方法在图像与视频生成任务中表现优异,迭代时间最高近 5 倍加速。
挑战Claude4的8B Agent!NUS提出AgenTracer:面向多智能体系统的失败归因
随着大语言模型发展,多智能体系统潜力大但有系统脆弱性问题。NUS研究者在论文中提出AgenTracer框架,构建标注管线,设计AgenTracer - 8B模型,在失败归因任务上超大型闭源模型,还能助力系统自我提升。
刚刚,OpenAI把1GW超算中心直接给了印度!奥特曼即将亲赴三哥办事处
OpenAI计划在印度建设至少1GW规模的数据中心,这是「星际之门」计划首次大规模进入亚洲。印度用户增长潜力大,还有多语言应用场景。虽奥特曼淡出CEO角色,但亲自推动全球算力布局,印度是关键起点。
41个榜单SOTA!智谱最新开源GLM-4.5V实测:看图猜地址、视频秒变代码
智谱基于GLM - 4.5打造的开源多模态视觉推理模型GLM - 4.5V,在42个公开榜单中41项夺得SOTA。其功能丰富,玩法升级,还为企业与开发者提供高性价比方案,是100B参数级SOTA标杆。
WAIC最强亮点:非Transformer离线AI大模型已大规模量产,大模型商业比我们想得更快
在WAIC上,RockAI推出非Transformer离线AI大模型Yan 2.0 Preview,有视觉感知跃升和自主学习能力两大提升。该公司走非Transformer路线,着重场景落地,通过“标杆战略”推动产品量产,未来构想构建“群体智能”世界。
AI PPT,这次是真不用返工了
过去AI做PPT虽快但有“幻觉数据”和“拼凑式模板”问题,被认为是高估需求。如今讯飞智文Vision Agent出现,能生成专业PPT,还解决了美观、内容等问题,将AI PPT带入2.0阶段。
半个月暴涨23k+ Star,一行命令让任意软件 Agent-Native!
介绍开源项目`CLI-Anything`,它用CLI作AI Agent与软件桥梁,有全新思路。半个月Github涨23k+ Star,能一键生成CLI,对接真实后端,但也有依赖代码质量、不适闭源软件等局限。
AI热点选品:当推荐系统遇上“热点”,我们需要一场变革
文章指出当下推荐系统追踪热点滞后,存在时效、解码、迭代困境。为此启动热点AI选品项目,构建自动化热点响应系统,经多环节处理输出优质候选集,还介绍成果、后续优化方向及AIGC图像生成方案。
29个月增长100倍:一个AI 2.0公司应该怎么建?HeyGen的取胜的秘密
AI视频生成公司HeyGen在29个月内ARR从100万美元增长到超1亿美元。创始人Joshua Xu公开取胜秘密,即独特运营模式‘The HeyGen Way’,包括拥抱变化、匹配节奏、最小化快速验证迭代等理念。
GPT-6 或有"生命"!MIT新作实现LLM自我进化,冻结权重时代终结
MIT新作《Self-Adapting Language Models》实现LLM自我进化,SEAL框架让模型自己生成“自编辑”微调自身。它能实时学新数据、修复知识、形成记忆。经两种场景验证,小模型也能超越GPT - 4.1等。