「视觉流」共找到 795 篇相关文章
40倍推理加速!复旦&微软:用「非线性流」拟合复杂轨迹,2步生成媲美原画
ArcFlow是复旦与微软提出的图像生成加速方案,引入非线性流拟合复杂轨迹。它在仅2步推理下保持画质,实现约40倍推理加速和4倍训练收敛加速,微调极少参数,在多模型验证效果出色。
Claude Opus 4.7突然发布:逐字级精准执行指令,软件工程和视觉能力大幅领先opus 4.6
Anthropic突然发布Claude Opus 4.7,重点提升软件工程能力,视觉能力也大幅跃升。指令遵循能力实质性提升,记忆能力改善。还同步上线新功能,升级前需关注分词器和token输出变化。
Unsloth宣布更新,可免费用强化学习训练视觉大模型Qwen2.5-VL-7B
Unsloth宣布更新,支持视觉/多模态模型强化学习训练,含Gemma 3和Qwen2.5 - VL。其独特机制使VLM RL训练速度提升、显存占用降90%等。还引入GSPO算法,能在免费Colab T4 GPU训练Qwen2.5 - VL - 7B。
MiniMax开源首个视觉RL统一框架,闫俊杰领衔!推理感知两手抓,性能横扫MEGA-Bench
MiniMax开源首个视觉RL统一框架V-Triune,由闫俊杰领衔。该框架通过三层组件设计和动态IoU奖励机制,让VLM能联合学习推理和感知任务。还开发Orsta模型系列,在MEGA - Bench表现出色,且MiniMax多模态布局动作多。
2025中国力学大会AI+分享 | 四川大学张来平研究员:基于图神经网络的流场预测方法研究进展
2025中国力学大会AI+分享中,四川大学张来平研究员介绍基于图神经网络的流场预测方法研究进展。张来平长期从事计算流体力学研究,近年专注AI for Science,成果颇丰。
GRPO训练不再「自嗨」!快手可灵 x 中山大学推出「GRPO卫兵」,显著缓解视觉生成过优化
GRPO在视觉生成流模型后训练阶段有显著提升,但clip机制存在系统性偏差,易使模型陷入过度优化。中山大学、快手可灵等团队提出GRPO - Guard,能降低过度优化风险,在多种任务中表现良好。
带图推理碾压同类开源模型!港中文微软等开源OpenThinkIMG框架,教AI学会使用视觉工具
港中文、微软等联合推出OpenThinkIMG开源框架,解决AI使用视觉工具面临的集成难、缺数据、适应差等问题,还公开核心技术V - ToolRL。该框架在图表推理任务上表现超GPT - 4.1,为下一代AI智能体提供基础。
视觉语言模型“扫地僧”:360低调开源FG-CLIP2登顶29项全球基准测试 | 甲子光年
两周前,360人工智能研究院低调开源FG - CLIP2,它在29个公开基准测试中超越Google和Meta的模型。该模型实现局部细粒度识别和原生双语对齐,为AI视觉理解设新基准,已服务开发者并在多领域落地。
产品经理也能“开发”需求?淘宝信息流从需求到上线的AI端到端实践
淘宝推荐信息流业务被“需求多、技术栈杂、协作慢”困扰,上线周期长。WaterFlow这一AI驱动的端到端开发实践,让部分需求两天内上线,产品经理也能参与。文章揭秘其落地及协作模式改变,还展示了实践效果。
AST | 西交大刘子扬、陈刚等:直接嵌入流场特征的智能化气动外形优化经验学习框架
传统气动外形优化方法有局限,本文提出智能化优化经验学习框架,结合DNN流场预测模型与DRL优化方法,还提出自适应网格再生成技术与Sigmoid奖赏函数,经验证效果良好,为气动优化提供新路径。