「视觉语言行动模型」共找到 7994 篇相关文章

算法论文8

再不怕乱引文献!绕过付费墙,BibAgent把学术核验转为证据链

大模型生成学术论述,其引用验证成难题,尤其付费墙后论文难以核验。BIBAGENT突破此困境,不破解付费墙也能验证引文语义真伪,还构建MISCITEBENCH评测,表现优异,为科学写作补“可审计基础设施”。

新智元
算法论文8

让机器人看视频学操作技能,清华等全新发布的CLAP框架做到了

近日,清华联合星尘智能、港大、MIT提出 CLAP 框架,能将视频运动空间与机器人动作空间对齐,解决‘数据饥荒’‘视觉纠缠’等问题,可让机器人从视频学技能,还缓解知识迁移难题,推动机器人产业化。

机器之心
推荐文章8

吴恩达来信:如何突破产品管理瓶颈

吴恩达指出编程助手带来“产品管理瓶颈”,即决定构建什么成难题。具备用户同理心的产品经理很关键,可凭直觉决策。还介绍通过多种策略获取用户反馈,强调用数据构建用户心理模型做决策。

DeeplearningAI
新闻资讯7

为什么HBM能摆脱传统周期?

当前市场对HBM和DRAM能否摆脱传统半导体周期性存争议。过去半导体周期由消费电子换机节奏驱动,而AI推理不同,大模型推理对内存依赖是硬约束,GPU更新对HBM需求几乎注定指数级增长。

newtype AI
7

Cursor SDK正式发布,“cursor” inside!

四月最后一天,Cursor正式发布TypeScript SDK,将智能代理运行时打包成可编程组件,跳出编程工具定义。它提供完整开发套件,支持双模部署,已有公司用其做三件事,还包含关键部分,Composer模型开放有战略价值。

AI工程化
新闻资讯7

“我让AI在我的电脑上为所欲为!”MoltBook创始人:爆火的技术,其实简单到离谱

MoltBook创始人Peter Steinberger称其是OpenClaw的延伸,外界对它解读“戏剧化”,但从技术角度看没什么震撼之处。真正关键的是敢让模型在电脑上自由运行,他还想让Agent“做梦”,项目会保持开源。

InfoQ
开源动态7

Vibe Coding撞墙了?换个思路治好AI编程的「局部失忆」

Vibe Coding虽降低开发门槛,但Coding Agent处理复杂任务易失控。当前Agent缺乏工程状态层隔离控制,Valkor等联合开源loom,它将交付拆解成状态链,过滤噪音,为大模型落地提供状态基建。

机器之心
新闻资讯8

刚刚,Anthropic发现Claude「类意识工作台」!神秘J空间藏着没说出口的想法

Anthropic新研究发现Claude内部存在特殊“J空间”,像静默心理工作区,浮现模型思考概念,不一定在回答里。此研究受关注,还揭示其特性、发现方式及应用,改变对Claude“心智”理解。

机器之心
新闻资讯7

GPT Image 2研究科学家陈博远:我在OpenAI修中文

GPT Image 2发布引发AI圈震动,主力训练者陈博远分享幕后故事。他和奥特曼同台主持,修好中文渲染,给模型起代号“布基胶带”,还设计多种“彩蛋级”测试,抖出官网图片幕后花絮。

量子位
算法论文7

成功率最高暴跌36.9%!南洋理工首个“模糊指令”测试,直击具身智能落地软肋

南洋理工大学MARS Lab团队联合发布测试基准REI-Bench,量化现有具身智能大模型缺陷。在其测试下,主流任务成功率最高降36.9%。研究还剖析错误原因,给出解法,望引起学界重视。

量子位