「图像驱动」共找到 1037 篇相关文章
无损加速视觉语言模型推理!轻松剪掉视觉冗余Token|腾讯AI Lab
多图像、长视频让大型视觉语言模型推理成本暴涨,成算力瓶颈。腾讯AI Lab联合CMU提出VScan,通过两阶段视觉token筛选机制,在几乎不损性能的前提下实现推理加速,且已在GitHub开源。
2K+ star!这款分分钟搭建 AI 知识库的项目,真的绝了!
GitHub上爆火的开源项目PandaWiki,两周揽2K star,是AI大模型驱动的知识库搭建系统。它将AI能力深度融入全流程,有强大富文本编辑等特色,还能灵活部署,适合中小团队和个人开发者。
PDF难点解析:处理复杂表格、水印、印章、复选框、信息抽取等7项任务,6大能力
文章介绍Nanonets - OCR - s可处理关键信息提取、视觉问答等7项任务,具备LaTeX方程识别、图像描述等6项能力,还给出体验链接。但测试发现英文体验优于中文,模型有重复输出、幻觉严重问题。
硅谷顶尖产品教练万字干货,一针见血揭示产品失败真相
文章回顾 Jim Morris 演讲,指出多数团队混淆“产出”与“成果”,迷恋“虚荣指标”。以 Power Reviews 为例,强调做对事才驱动客户价值。还介绍衡量成功的指标及应用案例,说明指标关联与先行指标作用。
SIGGRAPH 2025最佳论文出炉,清华、上科大、厦大获奖!谷歌拿下两篇
SIGGRAPH 2025技术论文奖项揭晓,投稿量首破970篇。5篇最佳论文涉及3D重建、图像个性化等前沿方向,清华、厦大、上科大均有入选,还有荣誉提名论文和时间检验奖论文公布。
“设计师的 Cursor”!拖拖拽拽就能做前端,AI 实时生成代码,代码设计双向同步!
Onlook是号称‘设计师的Cursor’的开源工具,可让用户在浏览器可视化构建前端界面,通过AI驱动双向绑定实现设计与代码实时同步,还具备多项核心功能,适用于多种场景,解决设计与开发痛点。
250美元起售,还开源,Hugging Face 发布史上最亲民人形机器人
Hugging Face 开源两款人形机器人 HopeJR 和 Reachy Mini,前者全尺寸有 66 个驱动自由度,售价约 3000 美元;后者成本低至 250 美元,可用于测试 AI 应用。虽被指外观不佳,但推动开源机器人生态发展。
NLWeb: 让每个网站都装上一个智能的“对话引擎”
微软近日开源NLWeb项目,致力于简化网站构建对话式交互界面的过程。它利用现有网络生态,定义协议让用户或AI代理与网站交互,具有降低门槛、开放社区驱动等优势,目标是构建“AI Web”。
实测惊艳全球的Veo3!音画同步无敌,贵是有原因的
谷歌开发者大会推出的Veo3模型,具备强大文本和图像转视频能力,首次实现视频与音频同步生成。实测中,它生成的视频音画效果惊艳,但也有翻车情况,谷歌还给出提示词编写指南。
谷歌超强 AI Agent 登场:攻克 300 年数学难题、改进芯片设计!编程迎来 AlphaGo 时刻?
谷歌 DeepMind 推出由 Gemini 驱动的 AI 智能体 AlphaEvolve,能自我进化解题。它破数学界 53 年纪录,解决 50 多个数学难题,还应用于谷歌数据中心、芯片设计等,提升效率。其进化方法独特,还能减少幻觉。