「视觉Agentic智能」共找到 5869 篇相关文章
OpenClaw之父爆猛料:Meta和OpenAI跪着抢人,小扎亲自求收购
OpenClaw之父Peter Steinberger做客播客,爆出Meta与OpenAI收购争夺内幕。他用一小时做出原型,打造出能自我修改源码的AI智能体,宣称AI智能体将消灭80%的App,编程会沦为「织毛衣」。
DeepSeek-OCR是「长文本理解」未来方向吗?中科院新基准给出答案
DeepSeek-OCR的视觉文本压缩技术降低长文本处理成本,中科院自动化所等团队推出VTCBench基准测试评估模型视觉认知,含三大任务及衍生版本,测试结果有‘U型曲线’,还评测多种尖端模型。
首次!AI智能体破解「纳什均衡」,大模型学会博弈论|Cell子刊
多所高校研究团队开发出PrimeNash大语言模型智能体框架,能自动推导纳什均衡闭式解析解并生成证明。它模拟人类科研路径,分三模块求解,经经典博弈验证,还在碳市场博弈展现应用潜力。
Hugging Face开源nanoVLM,750行代码可训练视觉语言模型,简单到令人发指!
Hugging Face开源全新视觉语言模型框架nanoVLM,仅750行代码就能从零训练高效能VLM模型。它在单张H100 GPU训练6小时后,在MMStar数据集准确率达35.3%,且能在免费Google Colab跑。
镜头被油污糊住,机器人还稳定操作?北大/清华等给VLA加一道信息筛选,不靠额外数据,效率提升14x,真机鲁棒性反而更高了 | ICML 2026
北大、清华等机构联合提出StableVLA,相关工作被ICML 2026接收。该工作提出轻量级IB - Adapter,不依赖额外数据对视觉特征筛选对齐,让机器人遇视觉干扰仍能稳定执行任务,实验展现出鲁棒性提升。
AI人形机器人+智能可穿戴时装大秀!领略东方语境下的未来人机美学
2025年濮院时装周上,数字艺术家余一萌携手众擎机器人带来《器生幻形》机器人时装秀。以数字孪生为核心,展示服装虚拟与现实一体化设计。大秀融合多元元素,为未来人机协同时尚打开想象空间。
智能体自己出现问题自己找!首次提出“自动化失败归因”课题 | ICML2025 Spotlight
LLM Multi - Agent系统失败诊断难,阻碍迭代优化。宾夕法尼亚州立大学等机构研究者首次提出“自动化失败归因”课题,构建Who&When数据集,开发评估多种归因方法,实验揭示当前方法不足。
OpenAI祭出GPT-5.4神装!Codex同款Harness全面开放
OpenAI重写Agents SDK架构,将其从‘聊天机器人玩具’变为‘生产级Agent底座’,原生收编七大沙盒,还把Codex经验产品化塞进SDK,这冲击了第三方框架,也让沙盒供应商纳入其生态。
李飞飞万字长文爆了!定义AI下一个十年
李飞飞最新长文指出,AI下一个前沿是「空间智能」,它能让「看见」升华为「推理」等。她揭秘了空间智能「世界模型」核心框架和三大核心支柱,还阐述了其应用领域及构建挑战。
P图老本事搭上了对话框,美图这AI Agent到底香不香?
本文对美图AI Agent RoboNeo进行实测。它web端操作简单,生图和p图功能丰富,拆分图层功能好用,工作流能辅助创作。不过它生成速度慢,视频生成有画面逻辑、文字生成等问题。其开发节奏快。