视觉编码」共找到 998 篇相关文章

产品应用8

Harness Engineering:AI 能在真正"出事会炸"的后端系统里写代码吗?

文章围绕AI能否在后端系统写代码展开,以腾讯CDN LEGO项目为例,介绍了项目背景与挑战,通过nonstop项目探测AI编码能力,分析AI Coding易翻车的问题及根因,构建Harness Engineering架构并实践,最终效率提升20%。

腾讯技术工程
算法论文8

头号玩家照进现实!NTU发布世界模型交互新范式,攻克主动操作难题

南洋理工大学MMLab团队推出Hand2World,让AI世界模型能真正互动。它摒弃旧有遮挡误导,用3D手部结构与射线编码解耦手与头运动,实现闭环持续交互,基于单目视频全自动标注,为AR、机器人交互铺路。

新智元
开源动态8

有人把 Opus 4.6 换掉了,成本省了 97%

智谱开源 GLM - 5.1,数小时获两百万 + 阅读,海外反应更热烈。它在多个编码基准测试成绩优异,如 SWE - Bench Pro 全球第一。还能完成长程任务,有开发者已用其替换 Opus 4.6 节省成本,但速度问题待解决。

AGI Hunt
产品应用7

CES 2026趋势照进现实:算力引擎RK182X重塑千行百业,瑞芯微AI生态大会共建落地生态

CES2026推动AI走向现实应用,瑞芯微RK182X作为AIoT2.0算力引擎,在视觉语言和大语言模型表现卓越,支持Qwen3 - VL系列模型。它在音频体验、多领域赋能出色,瑞芯微还构建产业生态促场景落地。

机器之心
算法论文8

边画边想!多模态Reasoning迎来巨大提升!

论文指出文本无法精准表达空间关系,现有视觉语言模型(LVLM)在空间推理上是短板。ViLaSR让模型直接画图推理,经三阶段训练,在五大空间推理测试中表现出色,还开源资源,有望带来机器认知升维。

深度学习自然语言处理
新闻资讯7

万字总结:如何练就适配人形机器人的可靠「灵巧手」?|GAIR Live

在具身智能崛起时,灵巧手成人工智能落地核心突破口。2025年5月25日相关线上沙龙中,嘉宾围绕灵巧手软硬件、数据与模型、落地应用等交流,探讨数据难题、开源价值、落地挑战及中美差距等。

AI科技评论
算法论文8

世界模型迎来因果升级:CD-LAM仅用几千步微调即可显著增强动作控制

Aether AI与加州大学圣地亚哥分校研究发现现有世界模型会无视动作控制信号,根源是隐动作模型受视觉混杂因素污染。团队提出CD - LAM,从上游净化隐动作表征,实验显示其能降动作误差、提画面质量,降低后训练开销。

机器之心
产品应用8

「双线实测」Qwen 3.6-Plus,Agentic Coding 已经这么能“扛活儿”了?

4月7日阿里云通义千问Qwen3.6-Plus上线,作者用两套真实复杂任务评估其智能体能力。结果显示它在复杂决策和编码任务表现出色,有工业级交付水准,但也有首字延迟等短板,且参数效率优势明显。

AI科技评论
产品应用8

豆包 Seed 2.0 来了:字节模型跨越鸿沟

春节前字节发布豆包大模型 2.0,其在 Text 领域进入榜单前十,视觉能力全球第四且成本低。它定位多模态 Agent 模型,有多种能力升级,文中用多个案例展示其强大,还强调字节重原生能力非简单蒸馏。

MacTalk
新闻资讯8

具身导航,感知推理到底是「上帝」,还是执行控制是「命门」?| GAIR Live 023

本文是GAIR Live 023圆桌对话实录,浙江大学彭思达与具身多模态算法专家郝孝帅探讨具身导航。涉及本质、范式、挑战、交互等方面,还对未来5 - 10年发展做了展望。

AI科技评论