图像定制化」共找到 1347 篇相关文章

推荐文章7

学习 AI 系统的设计实现及未来发展

本文是阿里巴巴算法专家曹宇在AICon 2025北京站的分享。从RLHF系统出发,结合实践展示RL系统现状与发展,探讨超大规模RL方向,涉及理论、业界实践、开源生态等,还介绍了AICon北京站活动。

InfoQ
推荐文章8

视觉生成的另一条路:Infinity 自回归架构的原理与实践

本文整理自字节跳动韩剑在AICon 2025北京站的分享,以Infinity为例介绍自回归视觉生成原理,对比其与扩散模型,展示Infinity升级方案成果,它在高分辨率文本到图像任务能与扩散模型竞争。

InfoQ
产品应用7

Browser Use 推出 Code Use:直接用代码控制浏览器

Browser Use 发布 0.9.0 版本,推出专为爬取数据设计的 Code Use。它开发特殊 Agent 和定制 LLM 输出特定代码,通过 CDP 直接操控浏览器,效率和准确性理论上更高,还给出使用示例,同时提醒了安全问题。

AI工程化
新闻资讯8

Mamba-3惊现AI顶会ICLR 2026!CMU知名华人教授一作首代工作AI圈爆红

Transformer有力挑战者Mamba的最新版本Mamba-3进入ICLR 2026盲审。它有三大改进,在长文本处理、实时推理和成本优有优势。此外,FBAM也从不同角度探索Transformer下一代框架。

新智元
算法论文8

NeurIPS 2025 Spotlight | FSDrive统一VLA和世界模型,推动自动驾驶迈向视觉推理

面向自动驾驶的多模态大模型存在问题,FSDrive提出“时空视觉CoT”,让模型“以图思考”,联合未来场景与感知结果进行可视推理。该方法在不改动原有MLLM架构前提下激活图像生成能力,实验表现出色。

机器之心
算法论文8

半在线RL新范式UI-S1,使得GUI Agent既稳定又规划长远

现有AI训练方法在GUI自动中各有弊端,本文提出半在线强学习范式,训练出UI - S1 - 7B模型,性能提升显著,还提出新评估指标SOP,是迈向实用AI智能体的重要一步。

深度学习自然语言处理
开源动态7

SGLang × RoleBasedGroup(RBG):打通大模型推理PD分离架构规模落地的“最后一公里”

PD分离架构对大模型推理部署意义重大,SGLang支持该架构且性能佳。但从测试到生产落地难,存在部署、资源、可靠性等问题。SGLang开源RBG项目,结合二者为PD分离架构生产落地提供方案。

InfoQ
产品应用8

李飞飞押注的「世界模型」,中国自研Matrix-3D已抢先实现了?

中国自研世界模型Matrix-3D可单张图生成3D世界,效果对标李飞飞的World Labs,还能实现更大范围探索。它有诸多优势,技术上有创新,数据集有特点,应用前景广泛。

新智元
产品应用8

在AI工具间来回切换了1年后,可灵用一张画布终结了它。

作者参加WAIC印象最深的是可灵更新,其首发灵动画布并升级多图参考功能。灵动画布可一站式完成图文视频创作,多图参考精准度提升,解决了AI工具孤岛问题,让创作更自由。

数字生命卡兹克
新闻资讯7

OpenAI 的“编程”新范式?其实是瀑布模型的回魂:“听 PM 的话、写需求文档”

在今年AI工程师大会上,OpenAI研究员Sean Grove提出在AI驱动时代,清晰规范将取代传统代码成软件开发核心产物。他认为编程核心是结构沟通,该转变是工程实践未来方向,但引发诸多讨论。

InfoQ