视觉 - 语言数据」共找到 3769 篇相关文章

开源动态8

VinciCoder:多模态统一代码生成框架和视觉反馈强化学习,数据代码模型权重已开源

中科院与美团团队推出 VinciCoder,打破多模态代码生成中 SFT 范式瓶颈。它将奖励机制转向视觉域,通过两阶段策略统一多样化代码生成任务,在多基准测试中表现卓越,为领域研究提供新范式。

机器之心
新闻资讯8

人形机器人交付元年,行业从卷模型转向拼数据

2026年是具身智能交付元年,行业从卷模型转向拼数据。全球权威机构重新定义“人形机器人数据”地位,真机数据是模型落地关键。乐聚等企业积极布局,通过训练场模式获取数据,解决行业痛点。

DeepTech深科技
新闻资讯8

翻译界的ChatGPT时刻!Meta发布新模型,几段示例学会冷门新语言

Meta人工智能研究团队发布Omnilingual ASR系统,能识别1600多种语言,可通过少量示例快速学会新语言。它以开源与社区共创为核心,打破语言技术不平等,让更多语言登上AI舞台。

新智元
新闻资讯7

Claude Code 生成 13 种编程语言代码基准测试:动态语言更快更省成本

Ruby 代码提交者远藤裕介评估 Claude Code 用 13 种编程语言生成代码的效率。经 600 多次测试,动态语言更快、更省成本且更稳定,静态类型语言慢且成本高。实验有局限,也引发质疑与回应。

InfoQ
开源动态8

刷新SOTA高出19.05分!英伟达开源OmniVinci全模态理解模型,只用1/6的数据,实现全方位超越

英伟达研究团队发布OmniVinci研究,该全模态理解大语言模型用六分之一训练数据,在全模态理解基准测试成绩超现有顶尖模型19.05分。它靠创新架构和数据策略实现效率与性能双突破。

AIGC开放社区
算法论文8

突破视觉-语言-动作模型的瓶颈:QDepth-VLA让机器人拥有更精准的3D空间感知

视觉 - 语言 - 动作模型(VLA)在机器人操控领域潜力大,但应对长时序或精细操作任务时性能下降,根源是缺乏三维空间感知与推理能力。中国科学院自动化研究所与灵宝 CASBOT 提出 QDepth - VLA 模型,提升了机器人空间推理与操控精度。

机器之心
算法论文8

说句话就能飞!北航发布语言交互的无人机控制模型

北航刘偲教授团队提出语言引导的细粒度无人机轨迹控制研究框架,定义Flow范式。采用模仿学习法让无人机响应指令,构建数据集和仿真评测基准,还提出协作策略和算法,实现真机部署。

量子位
开源动态8

Meta发布Omnilingual ASR:支持1600+语言的开源语音识别系统

Meta发布全新自动语音识别系统Omnilingual ASR,支持超1600种语言,核心创新是零样本和少样本学习能力,降低小语种语音识别门槛。项目提供不同规模模型,安装调用简单,目前仅支持40秒内音频,数据集和项目均开源。

AI工程化
开源动态8

视觉语言模型“扫地僧”:360低调开源FG-CLIP2登顶29项全球基准测试 | 甲子光年

两周前,360人工智能研究院低调开源FG - CLIP2,它在29个公开基准测试中超越Google和Meta的模型。该模型实现局部细粒度识别和原生双语对齐,为AI视觉理解设新基准,已服务开发者并在多领域落地。

甲子光年
新闻资讯7

具身智能的“生命线”:数据基石与未来路径 | GAIR Live 017

雷峰网举办具身智能数据线上论坛,三位嘉宾探讨其从数据采集到闭环学习全过程。指出具身智能数据挑战严峻,分享真机数据稀缺解决方案,认为仿真合成数据是必经之路,还谈及产学协同、数据服务等内容。

AI科技评论