多语言视觉问答」共找到 1663 篇相关文章

算法论文7

机器狗能当羽毛球搭子了!仅靠强化学习从0自学,还涌现出类人回位行为 | Science子刊

苏黎世联邦理工学院团队让机器狗靠强化学习学会打羽毛球,开发全身视觉运动控制策略,使其最高挥拍速达12米/秒,还涌现类人回位行为,研究证明足式机器人在体育场景应用可行。

量子位
推荐文章7

DeepSeek-R1发布100天后:全面复盘推理大模型复现研究及未来!

推理语言模型(RLMs)发展显著,DeepSeek - R1发布引发广泛影响且未完全开源。MiroMind等总结其复现研究,关注SFT和RLVR方向,介绍数据构建、方法设计、训练过程细节及实验关键发现。

PaperAgent
开源动态8

图像编辑太慢太粗糙?全新开源自回归模型实现精准秒级修改 | 智象未来

AI图像编辑中扩散模型有两大难题,智象未来团队提出全新自回归图像编辑框架VAREdit,引入视觉自回归架构,提升编辑精准度与速度。模型和代码已开源,还提出SAR模块优化,在基准测试表现出色。

量子位
开源动态8

群核科技开源两款空间大模型,想解决 Genie3 没能彻底解决的问题

2025年8月25日群核科技举办TechDay,发布专注3D室内场景的空间大模型,开源SpatialLM 1.5和SpatialGen。两款模型分别解决理解交互和空间一致性问题,有实际应用价值,还介绍了数据飞轮效应及模型相关问答

Founder Park
开源动态8

刚刚,智谱开源了他们的最强多模态模型,GLM-4.5v。

智谱接连开源GLM - 4.5和GLM - 4.5V,后者为多模态模型,总参数106B,在42个评测基准中41个达到SOTA。经测试,它视觉推理强、速度快,还有视频理解等功能,API定价良心,体现持续开放精神。

数字生命卡兹克
推荐文章7

AI们数不清六根手指,这事没那么简单。

作者测试发现Grok4、OpenAI o3等多模态模型都将六指图数成五指,仅Claude 4偶尔答对。研究揭示大模型看图片用记忆而非视觉,易受刻板印象影响,在工业等场景或引发严重后果。

数字生命卡兹克
算法论文8

vivo突破手机AI部署难题,绕开MoE架构限制,骁龙8 Elite流畅运行|ICCV 2025

在AI多模态时代,‘让大模型上手机’成焦点。现有MLLM在手机端部署有难题,vivo AI研究院等团队提出GenieBlue方案,绕开MoE架构限制,在骁龙8 Elite芯片手机流畅运行,保持语言性能同时实现多模态表现。

量子位
算法论文8

Cache Me If You Can:陈丹琦团队如何「抓住」关键缓存,解放LLM内存?

普林斯顿大学陈丹琦团队新论文聚焦长上下文语言模型 KV 缓存问题。传统 KV 缓存大小随输入文本长度线性增长,此前方法难公平比较。团队提出「KV 足迹」指标,改进方法并推出 PruLong 优化内存,节省空间且保性能。

机器之心
产品应用7

豆包可以跟你打视频了,陪我看《甄嬛传》还挺懂!难倒一众AI的“看时钟”也没难倒它

国产AI豆包发布视频通话新功能,能实时报准时钟时间,还接入联网搜索,准确性和时效性强。实测中,它可当看剧搭子,还能识别食材、解答物理题等,背后是豆包·视觉理解模型在发力。

量子位
开源动态8

视频字幕处理开源神器

卡卡字幕助手(VideoCaptioner)操作简单,无需高配置,支持 API 和本地离线语音识别,利用大语言模型处理字幕。它支持多平台视频下载处理,有专业语音识别引擎,能智能纠错、高质量翻译、调整字幕样式。

GitHubStore