视觉任务」共找到 2424 篇相关文章

算法论文8

超越RAG,DRAG让LLM准确率飙升45.5%,问题越复杂能力越强

RAG技术虽能让LLM检索资料生成答案,但存在短板,听不懂话里有话。DRAG方法应运而生,有DRA和RSC两大法宝,经对比实验,它在多任务上领先,准确率大幅提升,计算开销小。

AIGC开放社区
产品应用8

腾讯王者归来:混元图像3.0登顶LMArena!一手实测全球最强图像AI

LMArena最新榜单显示,腾讯「混元图像3.0」在文生图任务中夺冠,碾压谷歌Nano banana和字节Seedream 4。它9月28日开源,性能对标闭源模型,有强大推理、语义理解能力,支持中英文长文本渲染。

新智元
算法论文8

邱锡鹏老师团队发布VehicleWorld:让智能汽车真“智能”

邱锡鹏老师团队发布论文,构建高度仿真的智能座舱虚拟环境VehicleWorld,并提出基于状态的函数调用(SFC)方法。实验显示,SFC大幅提升任务执行准确率和效率,还构建了Vehicle Benchmark进行评估。

深度学习自然语言处理
算法论文8

大型语言模型稳定强化学习的新路径:几何平均策略优化GMPO

本文介绍了大型语言模型稳定强化学习新路径——几何平均策略优化GMPO。它是GRPO稳定化版本,通过优化几何平均替代算术平均,解决GRPO训练不稳定问题,在多任务实验中显著优于GRPO。

机器之心
新闻资讯3

马斯克Grok 4正式发布:世界最大AI超级计算机就训练了这?

Grok 4公开基准测试有进步,但在高级推理测试表现差,视觉理解仍是短板。性能提升多靠整合符号工具,无重大技术创新,‘幻觉’问题没实质进展,xAI官方对道德对齐信心不足。

AI寒武纪
算法论文8

AGI真方向?谷歌证明:智能体在自研世界模型,世界模型is all You Need

谷歌DeepMind研究人员表明,通用AI智能体处理复杂长期任务需学习内部世界模型,还证明可从智能体策略提取该模型。此研究成果补充多领域,对AI发展和安全意义重大。

机器之心
推荐文章7

对话灵感实验室:全帧率 VLM、低成本与分层部署,业务现场不止需要炫技模型

InfoQ对话格灵深瞳灵感实验室,探讨多模态大模型下视频理解问题。指出传统视频模型抽帧处理浪费算力和信息,介绍LLaVA - OneVision - 2.0突破长视频理解瓶颈,还提及“视觉智能工坊”助力业务落地。

InfoQ
新闻资讯7

独家|美图入局 Visual Agent,Chance AI 完成数百万美元天使轮融资

美图布局下一代视觉 AI 入口,领投 Visual Agent 创业公司 Chance AI 数百万美元天使轮融资。该公司成立于 2025 年 8 月,从北美大学生切入,有独特产品逻辑,融资后将推进多方向发展。

Founder Park
算法论文8

后训练中的RL已死?MIT新算法挑战传统后训练思维,谢赛宁转发

MIT研究人员提出RandOpt新算法,挑战传统后训练思维。该算法通过随机扰动和集成突破限制,在多任务中表现出色,揭示了预训练模型权重空间的“神经丛林”现象,引发AI社区关注。

机器之心
新闻资讯7

哈萨比斯:DeepMind才是Scaling Law发现者,现在也没看到瓶颈

哈萨比斯在Axios AI+峰会上称Scaling Law最早由DeepMind发现,靠它可能达成AGI,还预测未来12个月AI发展,如多模态融合、视觉智能突破等,且Gemini目标是成通用助手。

量子位