视觉 Agent」共找到 3296 篇相关文章

新闻资讯7

基于百万亿 Token 的 AI 使用模式分析:趋势、拐点与未来|PPT分享

近期OpenRouter报告《人工智能现状:基于OpenRouter的100万亿Token实证研究》,分析超100万亿个token的真实世界LLM交互数据,弥补LLM实际使用情况证据不足,揭示2024年转折及多方面发现。

AI大模型应用实践
开源动态7

Glyph:文本转图片解决长上下文困境,智谱把“DeepSeek-OCR”具像化了

传统 token 扩展方式遇算力成本天花板,DeepSeek 与智谱都想到让 AI“看”文字思路。智谱发布 Glyph 框架工程化实现此思路,将文本转图片处理,降低计算成本,有不错效果但也存在排版敏感等限制。

AI工程化
开源动态7

被DeepSeek带火的OCR,最新8个开源模型盘点~

DeepSeek-OCR发布让OCR大热,PaperAgent梳理盘点8个热门开源OCR模型,如DeepSeek-OCR用‘上下文光学压缩’技术,Nanonets-OCR2-3B以零样本视觉链式思维为核心等。

PaperAgent
新闻资讯7

2025云栖大会即将开幕,InfoQ 和你一起深度打卡!

9月24 - 26日,2025云栖大会将在杭州开幕,主题为‘云智一体·碳硅共生’。大会展示Agentic AI和Physical AI突破,探讨多领域话题。InfoQ与大会深度合作,全程陪伴打卡。

InfoQ
新闻资讯8

AI不会重写所有传统软件,但在重构产品逻辑!2025全球产品经理大会圆满收官

2025全球产品经理大会8月15 - 16日举办,超40位专家与近千名产品经理探讨AI产品构建。一线企业代表分享全链路经验,涉及十余个核心议题。还成立奇点智能研究院,各分论坛展示AI产品创新多维度亮点。

AI科技大本营
产品应用8

AI视频界变天!Decart发布实时“Sora”,直播/游戏业或遭降维打击

Decart创业公司推出全球首个实时、无限长度的AI视频模型MirageLSD,基于独创LSD技术。其响应低于40毫秒,靠历史增强等技术攻克难题。它不止用于特效,平台将持续升级,创始人目标是打造‘千亿级独角兽’。

AI工程化
新闻资讯7

奥特曼30亿刀收购案黄了!谷歌迅速出手:Windsurf核心团队打包带走

OpenAI豪掷30亿美元收购AI编程初创公司Windsurf一事告吹,谷歌迅速出手,将其核心团队打包带走,上演“雇佣式收购”。Windsurf团队将参与谷歌Gemini项目,负责编程Agent开发。

量子位
产品应用8

谷歌发布本地具身智能模型!全程无联网执行精细操作,从人形机器人到工业机器人全覆盖

Google DeepMind团队发布可本地运行的视觉 - 语言 - 动作模型Gemini Robotics On - Device,它能离线运行,操作能力强,可在多种机器人本体部署,解决网络问题,性能、适应能力出色,还开放了SDK。

量子位
新闻资讯7

AI大模型重塑学习硬件:从工具到伙伴 | 网易有道孟旭

网易有道词典笔产品负责人孟旭在AICon大会分享,以有道AI答疑笔为例,阐述智能学习硬件在大模型催化下从“学习工具”进化为“智能伙伴”,其发展呈“需求牵引 - 技术支撑 - 体验升级”螺旋路径。

AI前线
新闻资讯7

叫板 OpenAI Sora?Manus 推出文生视频服务,计划向所有用户开放

近日,Manus AI 推出文本转视频生成服务,支持单条提示完成视频制作,目前供部分订阅用户抢先体验,计划向所有用户开放,对标 OpenAI Sora 等竞品。其母公司获投资,还与微软合作,系统有独特优势。

AI前线