「弱监督动态场景图生成」共找到 2346 篇相关文章
极端天气也不怕漏检!RDA-YOLO:面向微小绝缘子缺陷检测的鲁棒动态自适应网络
文章指出传统绝缘子检测方法面临人工巡检效率低、小目标检测难等挑战,现有YOLO系列算法也有局限。为此提出RDA - YOLO网络,在YOLOv8基础上有三项创新,实验显示其精度、速度和极端天气鲁棒性表现出色。
ACL 2026|证据摊开看,场景图画清:让流式视频大模型拿捏「何时开口」
随着多模态和大语言模型发展,人类与 AI 交互走向共生。现有视频大模型难把握响应时机,西北工业大学等团队在 ACL 2026 提出 Response - G1 框架,实验显示其提升了模型性能。
真实场景也能批量造「险」!VLM+扩散模型打造真实域自动驾驶极限测试
浙江大学与哈工大(深圳)联合推出SafeMVDrive,将VLM关键车辆选择器与两阶段轨迹生成结合,可在真实域批量制造高保真安全关键视频,用于端到端自动驾驶系统安全性测试。
DeepSeek V3.1 把 R1 融了,一堆新活:<think>开关、动态搜索、新ToolCall ...
DeepSeek在Hugging Face悄悄发布V3.1版本,将对话和推理模型合并为混合推理模型。它有显式推理、内置搜索、简化工具调用等特性,Aider测试成绩佳且成本低,但也存在战术回避、幻觉率升高等问题。
【闭门会干货】字节 AI 最新动态:豆包升级+提示词神器+ SOTA 向量模型 + AI知识库 !
作者参加字节火山方舟开发者闭门会,分享诸多AI成果。豆包模型0715版较0615版能力提升显著;PromptPilot工具让提示词优化工程化;还有Responses API、AI知识库等实用工具,且有免费计划。此外,Seed1.6 - Embedding登顶多榜单SOTA,VikingDB升级,平台有协作奖励计划。
免剪辑直出!AI生成多角色同框对话视频,动态路由精准绑定音频
Bind-Your-Avatar基于扩散Transformer框架,通过细粒度嵌入路由将语音与角色绑定,实现精准音画同步,还引入数据集MTCC和基准测试,实验显示其在身份保真和音画同步上优于现有方法。
抛弃预定义Tool,首次提出通过动态工具生成的Agentic多模态Reasoning,破31%涨幅
视觉推理任务中,传统多模态大模型依赖预定义工具,灵活性与领域适应性差。PyVision 框架首次让 MLLM 在推理中实时生成、执行并迭代 Python 工具,在多类任务中显著提升性能,实现范式跃迁。
UIUC提出隐式监督新范式:无需标注/RM即可全面提升多模态Reasoning的感知能力
大型多模态模型在复杂多模态推理中面临挑战,67%错误源于视觉感知缺陷。为此,UIUC提出PAPO,通过隐式感知损失提升模型感知能力,无需额外标注,在多模态基准上表现优异,还解决了KL黑客问题。
MSRA清北推出强化预训练!取代传统自监督,14B模型媲美32B
微软亚洲研究院联合清北提出全新预训练范式RPT,将强化学习融入预训练,把预训练语料库重构为推理问题集。实验显示RPT-14B表现出色,在多方面媲美甚至超越32B模型,未来RL或在LLM预训练掀起风暴。
只用图像也能思考,强化学习造就推理模型新范式!复杂场景规划能力Max
现有 MLLM 依赖文本处理视觉信息,会造成信息丢失。剑桥、伦敦大学学院、谷歌团队提出视觉规划范式,以强化学习框架 VPRL 提升模型规划能力,实验显示其性能优于文本规划。