「视觉-语言生成」共找到 3485 篇相关文章
算力都去哪儿了?这个 Seedance 2.0 生成的梗视频给出了答案
有人用Seedance 2.0将Anakin and Padmé梗做成AI视频讽刺AI行业。视频对话暗示算力用途与宣称不符,最后几秒AI将帕德梅形象处理成擦边画风,揭示算力真实去向。
镜头被油污糊住,机器人还稳定操作?北大/清华等给VLA加一道信息筛选,不靠额外数据,效率提升14x,真机鲁棒性反而更高了 | ICML 2026
北大、清华等机构联合提出StableVLA,相关工作被ICML 2026接收。该工作提出轻量级IB - Adapter,不依赖额外数据对视觉特征筛选对齐,让机器人遇视觉干扰仍能稳定执行任务,实验展现出鲁棒性提升。
The Batch: 869 | 编码助手的训练数据
研究人员开发自动生成编码助手训练数据的流程。斯坦福等高校及阿里团队提出 SWE - smith 方法,从 128 个 Python 仓库入手合成漏洞、验证并生成修复样本,成果免费开放,有望改进 AI 辅助编程模型。
POF | 上海理工大学梁梓浩、朱兵等:使用大语言模型进行气泡湍流实验数据处理
本文提出结合大语言模型(Time - LLM)与Transformer模型的复合框架处理气泡两相流热膜测量信号干扰。先由Time - LLM识别气泡干扰信号,再用Transformer模型修复。实验证明该方法高效、轻量且物理自洽。
面向长时语音与声音克隆的全模态开源万能聊天机器人MGM-Omni
文章介绍了全模态开源聊天机器人MGM - Omni,它基于MiniGemini,支持多模态输入输出,具备长语音理解、生成、流式生成、零样本语音克隆等特性,还给出安装、使用方法,展示评估结果。
AI 编码圈新卷王 Magic Path 来了,Claude Engineer 团队出品,号称UI设计的 Cursor 时刻。
Magic Path是Claude Engineer团队推出的AI驱动UI设计工具,非开源但有免费额度。它AI先行,能按提示词生成组件和React代码,亮点诸多,上手体验佳,生成UI可用,还有页面串联等功能,虽有不足但潜力大。
京东广告大模型实战:GRAM 架构如何在 50ms 内完成生成式推荐?
流量红利见顶,广告营销转型遇挑战。京东张泽华在大会公开应对方案,介绍 GRAM 架构,实现意图与商品语义对齐,控制推理时延,解决冷启动等问题,还分享算法与知识工程实践。
“设计师的 Cursor”!拖拖拽拽就能做前端,AI 实时生成代码,代码设计双向同步!
Onlook是号称‘设计师的Cursor’的开源工具,可让用户在浏览器可视化构建前端界面,通过AI驱动双向绑定实现设计与代码实时同步,还具备多项核心功能,适用于多种场景,解决设计与开发痛点。
SeeDance 2.5:AI 一次能出 30 秒视频,被重新定价的是这几层人
7 月初,字节在火山引擎 FORCE 大会上放出 SeeDance 2.5,它能一次性生成 30 秒完整成片。文章详述其能力,提出视频生成的不可能三角判断框架,还分析它会重新定价产业链上多个环节,改写产出随机性。
3.4K星Apple出品FastVLM:视觉TTFT效率提升85倍,凭啥这么牛!
文章指出VLM在实际生产应用中因高分辨率图像存在效率问题,介绍Apple出品的FastVLM解决方案,阐述其架构、训练过程,展示在多个基准测试的性能,凸显在高分辨率输入下提升效率的优势及实际应用价值。