渐进式视觉压缩」共找到 883 篇相关文章

新闻资讯8

L4大方向有了:理想自动驾驶团队,在全球AI顶会上揭幕新范式

在全球计算机视觉学术顶会 ICCV 2025 上,理想汽车自动驾驶高级算法专家詹锟发表演讲,阐述了‘从数据到训练’的系统化思路,提出将世界模型与强化学习闭环落地于量产自动驾驶系统的完整架构。

机器之心
产品应用8

RecGPT-阿里的LLM推荐系统落地方案

文章介绍阿里RecGPT推荐系统落地方案,包括召回和推荐可解释性两方向。召回采用三塔结构,通过挖掘用户兴趣生成商品标签提升召回多样性。还提及行为序列压缩、推荐归因等,以及大模型微调和评估方法。

王喆的AI笔记
产品应用8

快手发布Keye-VL-1.5,同量级SoTA,让模型真正看懂视频!

近年来,多模态大语言模型兴起,但视频理解仍是难题。快手Keye团队推出Keye-VL-1.5,通过Slow-Fast编码策略、渐进式四阶段预训练和全面后训练流程等创新,实现视频理解突破,综合性能领先。

深度学习自然语言处理
算法论文8

港科广×腾讯联手打造《我的世界》神操作,400张截图就能让AI挖矿通关,成本降至5%|EMNLP 2025

港科广与腾讯联合团队提出VistaWise框架,将“跨模态知识图谱+轻量化视觉微调”引入开放世界智能体。实验显示其在“获取钻石”任务表现出色,成果被EMNLP 2025主会录用。该框架以低成本、跨模态为突破口。

量子位
产品应用7

全球首款AI原生游戏引擎再进化:GTA6再不来,我们就AI一个

GTA 6跳票成梗,其场景常被用于研究。一个多月前全球首个AI原生UGC游戏引擎发布,如今Mirage迭代为更强大的Mirage 2,支持多样场景,与Genie 3有不同优势且已上线,不过仍有技术问题待解决。

机器之心
算法论文8

ICML 2025 | CoTo:让LoRA训练「渐入佳境」,模型融合、剪枝样样精通

来自多机构研究者提出CoTo渐进式训练策略,解决LoRA训练难题。该策略在训练早期随机失活部分适配器,后期提高激活概率,提升模型融合、剪枝能力,还能增强单任务性能与训练效率,已被ICML 2025接收。

机器之心
新闻资讯7

95后北大校友挑起ChatGPT Agent大梁!今年刚博士毕业,曾获陶哲轩支持的AIMO第二名

OpenAI发布ChatGPT Agent项目,奥特曼重视有加,让两个华人挑大梁。孙之清从技术介绍强化学习训练,Casey Chu谈人类与Agent合作。孙之清是95后北大校友,Casey Chu领导过GPT - 4视觉输入原型开发。

量子位
开源动态8

超越O4-mini,多模态大模型终于学会回头「看」:中科院自动化所提出GThinker模型

现有多模态大模型在通用场景推理有瓶颈,缺乏对视觉线索校验与再思考能力。中科院自动化所提出GThinker模型,有创新的「线索引导式反思」模式,经两阶段训练,性能超O4 - mini,论文等已开源。

机器之心
新闻资讯8

Gemini 2.5 Pro强势更新并霸榜,Claude 3.7首次遭遇全方位碾压!

Google DeepMind推出的Gemini 2.5 Pro在LMArena各大排行榜全面登顶,实现文本、视觉、Web开发全方位霸榜,编码能力也大幅升级。虽有质疑,但短期内难有对手,还引发对Google I/O大会更多惊喜的期待。

AGI Hunt
开源动态8

Codex给V4-Flash装上眼睛,DeepSeek也会文档OCR

GitHub上的项目codex-vision-proxy让接进Codex的DeepSeek能看图,不用换模型或等官方,装本地代理即可。它还附带视觉工具包,在智能文档解析和OCR上潜力大,证明多模态能力可长在管道上。

CourseAI