「视觉语言预训练」共找到 3300 篇相关文章
大型语言模型正在掏空和填满你的钱包
人工智能改变赚钱和花钱方式,生成式AI每年或为全球经济增2.6 - 4.4万亿美元。文章介绍LLM在多领域应用,如客服降成本、内容创作提效率等,企业应积极拥抱技术革命。
半年复盘,AI迎来预训练后的新瓶颈。
2025年上半年AI领域发展加速,编码和多模态能力提升。但模型在综合能力上遇到第二轮瓶颈,编码能力强时通用认知能力‘拉胯’,或与RL阶段使用编程数据有关,红杉新基准或推动模型均衡发展。
刚刚,何恺明团队新作,「嵌入式语言流」ELF来了
何恺明团队提出ELF模型,将扩散过程置于连续向量空间,只在最后翻译成词。它用一个网络实现去噪和解码,引入自条件机制。实验显示,ELF用不到其他方法十分之一数据,生成质量全面领先。
「听觉」引导「视觉」,OmniAgent开启全模态主动感知新范式
针对端到端全模态大模型痛点,浙江大学、西湖大学、蚂蚁集团联合提出 OmniAgent,它基于「音频引导」,用「思考 - 行动 - 观察 - 反思」闭环实现范式转变,在多基准测试中超越开闭源模型。
准确率腰斩!大模型视觉能力一出日常生活就「失灵」
EgoCross项目团队聚焦跨域第一视角视频问答评测,揭示现有MLLM在多场景泛化瓶颈。团队提出跨域第一视角视频问答基准EgoCross,经测试揭示模型短板,验证改进方法潜力,研究入选AAAI 2026且数据集等已开源。
阿里、南开大学发布免训练,视频大模型创新压缩方法
视频模型序列化处理影响推理速度与扩展性,传统token压缩方法在视频理解中有问题。阿里通义实验室与南开联合发布LLaVA - Scissor,用SCC方法和两步时空压缩策略,实验显示其性能优于其他方法。
Agent 走向具身世界:从语言智能到机器人「大脑指挥官」
华为诺亚方舟实验室发布 RoboHarness 系统,解决不同策略协作问题。它将独立控制系统封装成可调度技能,由 Coding Agent 决策,还设计辅助技能和 Memory Bridge 模块,促进策略协同,推动具身智能发展。
AI生图免训练提速1000%,办法:最简洁的“三阶段流水线”
AI画图速度慢,过往主流加速方法有局限。MrFlow团队提出三阶段流水线,在Qwen - Image等模型上实现10倍以上端到端加速,生成效果好,优势显著,还能与时间步蒸馏叠加,且完整开源。
别人都在卷视觉,这家具身公司偏要卷“手感”
非夕科技坚持力觉优先路径研发具身智能,过去十年专注自研机械臂,产品应用广泛。此次推出Enlight初昕系列机械臂和MICO双臂机器人平台,还构建模块化产品生态,定位通用机器人基座平台,为具身智能落地打基础。
告别「边画边说」:LatentMorph 开启视觉生成隐式潜空间推理新范式
现有的文生图模型缺乏动态思考与自我修正能力,香港科技大学团队提出LatentMorph框架,将隐式潜空间推理集成到T2I生成过程中,实验显示其显著提升基座模型性能,削减推理延时与Token消耗,实现人机认知对齐。