结构化图像」共找到 1539 篇相关文章

算法论文8

NeurIPS 2025 Spotlight | FSDrive统一VLA和世界模型,推动自动驾驶迈向视觉推理

面向自动驾驶的多模态大模型存在问题,FSDrive提出“时空视觉CoT”,让模型“以图思考”,联合未来场景与感知结果进行可视推理。该方法在不改动原有MLLM架构前提下激活图像生成能力,实验表现出色。

机器之心
算法论文8

半在线RL新范式UI-S1,使得GUI Agent既稳定又规划长远

现有AI训练方法在GUI自动中各有弊端,本文提出半在线强学习范式,训练出UI - S1 - 7B模型,性能提升显著,还提出新评估指标SOP,是迈向实用AI智能体的重要一步。

深度学习自然语言处理
开源动态7

SGLang × RoleBasedGroup(RBG):打通大模型推理PD分离架构规模落地的“最后一公里”

PD分离架构对大模型推理部署意义重大,SGLang支持该架构且性能佳。但从测试到生产落地难,存在部署、资源、可靠性等问题。SGLang开源RBG项目,结合二者为PD分离架构生产落地提供方案。

InfoQ
产品应用8

李飞飞押注的「世界模型」,中国自研Matrix-3D已抢先实现了?

中国自研世界模型Matrix-3D可单张图生成3D世界,效果对标李飞飞的World Labs,还能实现更大范围探索。它有诸多优势,技术上有创新,数据集有特点,应用前景广泛。

新智元
开源动态8

面向6G环境感知通信!西电开源3Dx3D无线电地图数据集与生成式基准框架

面向6G,西安电子科技大学等团队联合提出高分辨率多模态三维无线电图谱数据集UrbanRadio3D,构建三维无线电图生成框架RadioDiff-3D,弥补了当前主流RM构建方法与数据集的局限。

新智元
产品应用8

在AI工具间来回切换了1年后,可灵用一张画布终结了它。

作者参加WAIC印象最深的是可灵更新,其首发灵动画布并升级多图参考功能。灵动画布可一站式完成图文视频创作,多图参考精准度提升,解决了AI工具孤岛问题,让创作更自由。

数字生命卡兹克
算法论文8

机器人高层指挥低层做,“坐标系转移接口”一次演示实现泛学习 | ICML2025

美国东北大学和波士顿动力RAI提出HEP框架,首创“坐标系转移接口”,有极简高效分层结构、空间对称性自然泛、创新型体素编码器等亮点。它基于分层策略和接口,提升机器人操作灵活性与泛性,论文被ICML2025收录。

量子位
产品应用7

AI编码不是梦:手把手教你指挥Agent开发需求

文章聚焦AI实践应用,以后端开发为例,介绍用AI编码实现需求的流程,涵盖工程结构、各层代码生成等。还分析AI编程问题,提出解决方案,给出生产案例,最后展望AI在研发中的应用前景。

阿里云开发者
推荐文章7

4人团队,连做两款AI教育爆款,AI时代小团队创业取胜指南

Oleve是仅4人AI创业公司,年收入达600万美元。旗下Quizard和Unstuck AI成爆款。其成功在于技术敏锐,用OpenAI Codex起步;有“精益增长”策略;且实现流程全面自动,为小团队创业提供样本。

Founder Park
新闻资讯8

马斯克发布“地球最强AI模型”Grok 4:横扫所有榜单,在“人类最终测试”超越人类博士”!

北京时间7月10日,马斯克团队发布Grok 4,其基准测试成绩惊人,在‘人类最终测试’等表现出色。它成功源于多智能体协作、追求真相哲学和高算力投入,还在多领域展现应用潜力,同时公布定价并坦言短板。

AI科技大本营