视觉能力」共找到 3617 篇相关文章

新闻资讯8

国产大模型「五强争霸」,决战AGI!

中国基础大模型市场形成「基模五强」格局,包括字节、阿里、阶跃星辰、智谱和DeepSeek。它们要么有钱,要么有人,各有特色与优势。未来竞争焦点是追求更高「智能上限」和突破「多模态能力」,决战AGI。

新智元
新闻资讯7

0人类数据,让机器臂自学拧灯泡:MIT初创要打造机器人界的AlphaZero

Eka Robotics 发布机械臂视频,其能自主拧灯泡、抓取物品。该公司提出 VFA 模型,不依赖人类数据,让机器人在仿真环境自主探索。创始人期望实现超人级灵巧操作,算法还展现泛化和自主发明策略能力

DeepTech深科技
算法论文8

让机器人看视频学操作技能,清华等全新发布的CLAP框架做到了

近日,清华联合星尘智能、港大、MIT提出 CLAP 框架,能将视频运动空间与机器人动作空间对齐,解决‘数据饥荒’‘视觉纠缠’等问题,可让机器人从视频学技能,还缓解知识迁移难题,推动机器人产业化。

机器之心
新闻资讯8

谷歌开发者大会炸场!Agent重磅升级, A2A、SDK大更新

今天凌晨谷歌召开‘I/O 2025’开发者大会,对Agent智能体重磅升级。A2A协议更新,新增关键功能,还发布官方Python SDK;生态持续扩大,多家名企加入。此外,发布Agent Engine UI,升级Agent SDK,增强Project Mariner能力

AIGC开放社区
推荐文章8

对谈openai首席产品,AI时代的产品思路。

知名播客主理人Lenny对OpenAI CPO Kevin Weil进行访谈,分享了OpenAI内部的产品哲学,包括Model Maximalism、Iterative Deployment、Evals等方法论,还谈及AI技术演进、未来机遇等思考,鼓励培养核心能力应对AI变革。

探索AGI
新闻资讯7

Synk收购Invariantlabs-AI安全技术的强强联手

2025年6月24日,安全AI软件开发领导者Snyk宣布收购AI安全研究公司Invariant Labs。Snyk CEO称收购增强了抵御新兴威胁能力。Invariant Labs在MCP领域领先,成果丰富,Snyk也有多样产品,合并有望带来1+1>2效果。

AI与安全
开源动态8

微软开源了一款 skill 神器,这下爽了!

近期微软开源桌面应用 `Skill Recorder`,1个多月揽3K star。它能录屏幕操作,借助 GitHub Copilot CLI 生成可复用 Skill 或 Automation,与 RPA 思路不同,有泛化能力,可按命令快速安装。

开源先锋
新闻资讯7

国产开源模型越多,模型路由的机会越大

中国大模型市场模型增多,能力相近、价格降低且部分开源。开发者选择多但企业选模型难,价值向调度层转移。开源改变产业结构,Routing业务有价值且至少含四层,中国Provider Routing易落地。

newtype AI
推荐文章8

手工软件工程师的时代已经结束!一位连续创业CTO的判断

连续创业者、Tessi.ai CTO Ben Greene 在访谈中指出,生成式 AI 改变软件工程形态,手工软件工程师时代过去。工程师应转向理解问题、设计系统,具备系统思维、业务理解和与人协作能力,学会“AI 编排”。

InfoQ
推荐文章8

解决算力瓶颈,给多模态瘦身!Token压缩完整图谱与选型指南

给多模态大模型瘦身是解决算力瓶颈的关键。Token压缩技术可剔除视觉冗余,提升训练与推理效率。北大等团队剖析其全貌,给出完整图谱与选型指南,还揭示了未来演进路径。

AIGC开放社区