视觉推理任务」共找到 3940 篇相关文章

算法论文8

刷榜自动驾驶语义场景补全!北大新作:高维度、高密度 | AAAI'26

北京大学彭宇新教授团队提出视觉语义场景补全方法HD² - SSC,通过高维度语义解耦和高密度占用优化,解决现有技术维度与密度差异问题,在两自动驾驶数据集上取得最优性能。

新智元
算法论文8

2篇最新152页论文,RL+LLM被彻底讲透了!

今天分享2篇2025最新RL×LLM的技术综述,分别聚焦“RL在LLM全生命周期的打法”和“RL如何炼成大推理模型”,梳理玩法、组件、算法演进等内容,还给出开源模型、数据等盘点。

PaperAgent
开源动态8

语音“PS”来了!蚂蚁又放大招,ASR+TTS+编辑的全能语音模型开源了!

在大模型浪潮下,语音领域迎来“整合与统一”趋势。阿里蚂蚁团队推出端到端统一语音模型Ming - UniAudio,能在一个框架下完成识别、生成、编辑等任务,语音编辑能力创新,开发者上手简单。

开源星探
产品应用7

本地运行OpenAI Whisper语音识别模型,Unity3d环境下高性能离线转写解决方案

这是为whisper.cpp提供的Unity3D绑定库,能在本地设备高性能运行OpenAI Whisper自动语音识别模型推理。支持多语言识别与翻译,有不同大小模型,可本地运行,还介绍了使用方法。

GitHubStore
新闻资讯7

Claude Opus 4.1被曝即将发布!Anthropic靠两大客户API收入超OpenAI

Claude Opus 4.1被曝正在内部测试,或重点提高推理和规划能力。Anthropic过去7个月ARR涨至50亿美元,API收入超OpenAI。但它收入依赖AI编程,面临GPT - 5、Grok等竞争。

量子位
开源动态7

从文心开源谈起,论大模型发展新生态

6月30日百度宣布开源ERNIE 4.5即文心4.5系列模型,实现预训练权重+推理代码完全开源。文心团队提出创新架构,增强多模态理解能力。今晚7:30,CSDN邀专家深度解读文心开源及行业趋势。

AI科技大本营
算法论文8

VLA模型为何忽视语言?破解指令跟随幻觉,分布外场景泛化新突破

当前VLA模型常依赖视觉线索而非语言指令,导致新场景表现不佳。论文提出LangForce方法,引入对数似然比损失,强化模型对语言的依赖,提升分布外泛化能力,还保留语言核心功能。

新智元
开源动态8

继Harness之后,“龙虾”JiuwenClaw率先开启“Coordination Engineering”时代

AI工程范式迭代快,行业面临‘定义赶不上进化’的焦虑。华为支持的openJiuwen社区发布新版JiuwenClaw,新增多智能体协同能力,提出‘Coordination Engineering’,实测中表现出高稳定性,可自主完成多项任务

量子位
新闻资讯7

扒一扒Meta全新大模型Muse Spark里藏着的PDR技术

Meta发布闭源大模型Muse Spark及‘沉思模式’,背后藏PDR推理技术。该技术通过‘并行起草+精炼’突破性能瓶颈,对比传统长CoT范式优势明显,在AIME竞赛题目测试中准确率显著提升。

PaperAgent
产品应用8

世界模型原生新一代范式!极佳视界斩获全球第一后,GigaBrain-0.5M*再进化

具身世界模型新一代原生范式登场,GigaBrain-0.5M*在多真实机器人任务中数小时零失误。它依托世界模型,创新引入人在回路机制,研发采用四阶段闭环训练流程,优势显著。

机器之心