「视觉 Agent」共找到 3296 篇相关文章
基于百万亿 Token 的 AI 使用模式分析:趋势、拐点与未来|PPT分享
近期OpenRouter报告《人工智能现状:基于OpenRouter的100万亿Token实证研究》,分析超100万亿个token的真实世界LLM交互数据,弥补LLM实际使用情况证据不足,揭示2024年转折及多方面发现。
Glyph:文本转图片解决长上下文困境,智谱把“DeepSeek-OCR”具像化了
传统 token 扩展方式遇算力成本天花板,DeepSeek 与智谱都想到让 AI“看”文字思路。智谱发布 Glyph 框架工程化实现此思路,将文本转图片处理,降低计算成本,有不错效果但也存在排版敏感等限制。
被DeepSeek带火的OCR,最新8个开源模型盘点~
DeepSeek-OCR发布让OCR大热,PaperAgent梳理盘点8个热门开源OCR模型,如DeepSeek-OCR用‘上下文光学压缩’技术,Nanonets-OCR2-3B以零样本视觉链式思维为核心等。
2025云栖大会即将开幕,InfoQ 和你一起深度打卡!
9月24 - 26日,2025云栖大会将在杭州开幕,主题为‘云智一体·碳硅共生’。大会展示Agentic AI和Physical AI突破,探讨多领域话题。InfoQ与大会深度合作,全程陪伴打卡。
AI不会重写所有传统软件,但在重构产品逻辑!2025全球产品经理大会圆满收官
2025全球产品经理大会8月15 - 16日举办,超40位专家与近千名产品经理探讨AI产品构建。一线企业代表分享全链路经验,涉及十余个核心议题。还成立奇点智能研究院,各分论坛展示AI产品创新多维度亮点。
AI视频界变天!Decart发布实时“Sora”,直播/游戏业或遭降维打击
Decart创业公司推出全球首个实时、无限长度的AI视频模型MirageLSD,基于独创LSD技术。其响应低于40毫秒,靠历史增强等技术攻克难题。它不止用于特效,平台将持续升级,创始人目标是打造‘千亿级独角兽’。
奥特曼30亿刀收购案黄了!谷歌迅速出手:Windsurf核心团队打包带走
OpenAI豪掷30亿美元收购AI编程初创公司Windsurf一事告吹,谷歌迅速出手,将其核心团队打包带走,上演“雇佣式收购”。Windsurf团队将参与谷歌Gemini项目,负责编程Agent开发。
谷歌发布本地具身智能模型!全程无联网执行精细操作,从人形机器人到工业机器人全覆盖
Google DeepMind团队发布可本地运行的视觉 - 语言 - 动作模型Gemini Robotics On - Device,它能离线运行,操作能力强,可在多种机器人本体部署,解决网络问题,性能、适应能力出色,还开放了SDK。
AI大模型重塑学习硬件:从工具到伙伴 | 网易有道孟旭
网易有道词典笔产品负责人孟旭在AICon大会分享,以有道AI答疑笔为例,阐述智能学习硬件在大模型催化下从“学习工具”进化为“智能伙伴”,其发展呈“需求牵引 - 技术支撑 - 体验升级”螺旋路径。
叫板 OpenAI Sora?Manus 推出文生视频服务,计划向所有用户开放
近日,Manus AI 推出文本转视频生成服务,支持单条提示完成视频制作,目前供部分订阅用户抢先体验,计划向所有用户开放,对标 OpenAI Sora 等竞品。其母公司获投资,还与微软合作,系统有独特优势。