人类在环」共找到 8668 篇相关文章

新闻资讯8

画质重生,第一!腾讯TEG香农实验室斩获CVPR 2025 UGC Video Enhancement 冠军

CVPR NTIRE是计算机图像恢复与增强领域有影响力的赛事。NTIRE 2025 UGC Video Enhancement中,腾讯TEG香农实验室团队自研算法夺冠,成果落地提升视频清晰度。团队还参加实时赛道获佳绩,且做了硬件推理优化。

腾讯技术工程
算法论文8

让GUI Agent不再「边做边忘」:快手、浙大提出MemGUI-Agent,攻克长程GUI任务

手机GUI Agent长程任务中易遗忘关键信息,浙江大学APRIL实验室和快手主站技术部提出MemGUI - Agent,核心是ConAct,将上下文管理变为Agent动作,还开源MemGUI - 3K数据集,模型评测基准取得佳绩。

量子位
新闻资讯7

DeepSeek多模态真的来了?识图模式已开始小范围灰度

4月29日,DeepSeek多模态团队负责人陈小康X发布动态暗示多模态进展。部分用户DeepSeek官方App灰度到“识图模式”,这是其主线产品首次有图像理解能力模式,此前多模态人才有流失,官方未说明开放细节。

DeepTech深科技
算法论文8

0.005%参数量超越SOTA!提升模型能力无需庞大奖励模型

上海交通大学等校联合团队提出轻量级奖励模型SWIFT,利用大模型隐藏状态线性特征,仅训练极小线性层,推理任务中超越主流奖励模型,实现计算效率与准确率双提升,且多领域表现出色。

AIGC开放社区
算法论文8

Apple发布新SOTA Manzano:混合Tokenizer破解多模态统一难题,理解与生成双翼齐飞

多模态AI前景广,但现有模型理解和生成任务上存性能冲突。苹果提出Manzano模型,用混合视觉标记器降低任务冲突,结构简单可扩展,多基准测试达SoTA水平,还展示图像编辑潜力。

深度学习自然语言处理
算法论文8

抛弃预定义Tool,首次提出通过动态工具生成的Agentic多模态Reasoning,破31%涨幅

视觉推理任务中,传统多模态大模型依赖预定义工具,灵活性与领域适应性差。PyVision 框架首次让 MLLM 推理中实时生成、执行并迭代 Python 工具,多类任务中显著提升性能,实现范式跃迁。

深度学习自然语言处理
算法论文8

UIUC提出隐式监督新范式:无需标注/RM即可全面提升多模态Reasoning的感知能力

大型多模态模型复杂多模态推理中面临挑战,67%错误源于视觉感知缺陷。为此,UIUC提出PAPO,通过隐式感知损失提升模型感知能力,无需额外标注,多模态基准上表现优异,还解决了KL黑客问题。

深度学习自然语言处理
算法论文8

国产多模态Agent拿下医学分割SOTA!不用改模型、不加token | 浙大&上海AI Lab

现有医学多模态大模型分割生物医学图像时存瓶颈,浙大蔡钰祥教授、上海AI Lab江彦开等人提出IBISAgent框架,将分割定义为多步视觉决策过程,实验显示其多数据集上大幅领先对比方法。

量子位
新闻资讯7

1个决定痛失千万美元!90后前英伟达工程师不后悔:老黄这3句更值钱

2022年深秋,Sid PardeshiChatGPT爆发前夜辞去英伟达高级工程师职位,错过数千万美元股票收益。他不后悔,英伟达七年多从黄仁勋处学到比财富更值钱的东西,还总结出黄仁勋管理哲学的三个启示。

新智元
开源动态8

Clawdbot爆火:Karpathy点赞的开源AI助理,到底是什么?

这两天AI圈被Clawdbot项目刷屏。它是能手机已有应用中工作的AI助理,有记忆、会主动联系用户、能执行任务。它可廉价云服务器运行,能力分两层级,成本每月25 - 150美元。

AI寒武纪