视觉智能体」共找到 3984 篇相关文章

新闻资讯7

ClockBench:一个简单的钟表测试让AI全线溃败

ClockBench测试让11个多模态大模型与5个普通人认钟表时间,人类平均准确率89.1%,最好的AI仅13.3%。AI在复杂钟面表现差,却能处理抽象指令。该测试暴露视觉AI空间推理缺陷,对评估有启发。

AI工程化
新闻资讯8

李志飞:1 个人、2 天做出 AI 时代的「飞书」,真正的 Founder Mode

出门问问创始人李志飞在「TicNote」发布会上分享「一人公司」实验。他用AI编程工具2天做出AI时代“飞书”原型,还谈了使用AI编程问题、对智能和Agent思考等,重新找回AGI信仰。

Founder Park
新闻资讯7

刚刚,Manus恢复独立运营

曾被Meta收购的Manus宣布恢复独立运营,为满足数据合规,需删除部分收购后产生的数据。它开发备份和恢复工具,还准备新功能拓展通用AI智能能力边界。其出道曾即巅峰,后被收购,如今又回归。

量子位
开源动态8

百度Qianfan-VL开源,纯国产自研昆仑芯跑出世界一流

百度开源全新视觉理解模型Qianfan-VL,有3B、8B和70B三个版本,在昆仑芯P800芯片上训练。该模型多模态能力强,OCR和教育场景表现突出,跑分超国际主流模型。芯片功耗低、架构优,模型训练方法创新。

AIGC开放社区
算法论文8

ECCV 2026 | 一段视频,重建一个可仿真的动态世界

机器人走出实验室后,训练数据需覆盖真实世界情况。OVOW由多团队完成,被ECCV 2026接收。它从单目视频出发,输出可编辑、可碰撞的实例级Mesh,串联视觉基础模型完成流水线工作,能用于物理仿真。

机器之心
新闻资讯8

英伟达All in的物理AI路线,居然是中国黑马提前一年就定义好了

全球具身智能行业为技术路线争论时,中国深度机智率先提出并跑通「人类学习」路线,以人类数据为起点、动作建模为中心、机器人为AI而生,英伟达等跟进,深度机智全栈落地且进度领先。

新智元
产品应用7

Claude Opus 4.7来了,公开模型里的SOTA!不过用起来GPT味好浓

Anthropic推出Claude Opus 4.7,虽有像GPT的争议,但在多方面表现出色。它在高级软件工程、视觉能力等四大方向升级,且具备防护措施和记忆增强。全平台开放,与Opus 4.6同价,使用有注意事项。

量子位
新闻资讯7

起底Sharpa:一家还没赚钱的公司为何估值快赶上禾赛?

神秘具身智能公司Sharpa亮相引发关注。它以灵巧手技术获认可,后转型整机公司发布机器人North。其团队有禾赛背景,自带硬科技基因,受资本青睐,反映供应链切入下游和整机的产业趋势。

AI科技评论
新闻资讯8

百川开源医疗大模型 M3,王小川:今年会发布两款 ToC 产品,正在做硬件

1月初OpenAI、Anthropic推出医疗产品,百川智能也开源医疗大模型Baichuan - M3,评测成绩突出。王小川表示今年会发布两款ToC产品,还在做硬件,阐述了百川在医疗领域的目标与策略。

Founder Park
产品应用7

Nano Banana Pro 一键极速分镜

Nano Banana Pro能通过一个提示生成叙事型九宫格分镜,用户可构思故事或修改已有故事,还能放大分镜、提示AI修改,该流程极大提升视觉叙事速度,文中还给出提示词示例及任务要求。

AI进修生