「文档图像解析」共找到 944 篇相关文章
实测 Seed 2.1:豆包基模超进化,国产模型能力跨过质变点
作者在做面向 Agent 项目时,因 Claude Code 内存开销大,需更轻方案。火山引擎 Force 大会发布 Seed - 2.1,作者实测其在办公、编程、图像理解等方面表现出色,认为它跨越质变点,将赋能国内 AI 生态圈。
多模态思维链如何重塑 AI 与短视频的未来
传统多模态模型在动态视频理解与复杂推理场景面临挑战,快手开源的 Keye-VL 模型在多模态思维链技术实现突破。文章解析其核心技术,分享在快手短视频社区的落地应用,还探讨了未来“Think with Video”的技术方向。
新鲜出炉!谷歌nano banana模型刷屏背后技术揭秘
谷歌Nano Banana模型刷屏,其项目负责人等揭秘技术。它有场景一致性、文本渲染等特性,团队用文本渲染能力作评估指标,还靠原生多模态、交错式生成等技术,结合用户反馈实现多方面进步,图像模型做PPT尚处起步。
浙大开源PhyEdit:单图编辑+精准3D物体操作 | ACM MM'26
浙江大学ReLER团队开源的PhyEdit,用3D foundation model明确目标几何,让DiT图像编辑器负责最终渲染。单张图片里物体能移动并形成连续状态,在多项指标表现出色,还具备多种能力,已被ACM MM 2026接收。
95%的人还在手动提取数据,用这个工具秒变结构化
文章介绍Google开源的LangExtract,它基于大语言模型,能将非结构化文本转为结构化数据。有精准溯源、少样本定义等6大优势,可3步完成安装配置,还介绍基础使用、长文档处理、多模型支持及实战案例等内容。
突发!Claude挑战黎曼猜想「失败」,却意外刷新37年数学纪录
AI向黎曼猜想发起挑战,Anthropic的Claude研究版本虽未攻克该猜想,但将黎曼ζ函数中已知至少位于临界线上的零点比例下界,由41.6%提高到了67.2%,这可能是解析数论领域重大进展。
腾讯用AI把美术管线重新做了一遍,混元3D Studio架构曝光
腾讯推出专业级AI工作台混元3D Studio,可覆盖3D资产生产全流程,让生产周期大幅缩短。它有组件拆分、可控图像生成等七大核心技术模块,各模块对应关键阶段,实现无缝衔接与自动化。
Claude第一款AI桌宠硬件,深圳制造
Anthropic的开源项目Claude-Desktop-Buddy,首款AI桌宠硬件用深圳M5Stack的M5StickC Plus。A社选它或因工程师是用户且新款常断货,也因其文档和代码可靠。深圳供应链强,M5Stack调整使命为AI世界准备基建。
刚刚,首个能在机器人上本地运行的具身Gemini来了
谷歌DeepMind推出Gemini Robotics On-Device,这是首个可部署在机器人上的VLA模型,无需联网,能让机器人适应新任务和环境。还将发布SDK助开发者评估。此外,谷歌下调Gemini免费额度,推出图像生成模型Imagen 4和Imagen 4 Ultra。
小扎「芒果」生图只输GPT Image 2,没人教它改稿,它自己学会了
Meta推出图像生成模型Muse Image(代号「芒果」)和视频模型Muse Video预览版。Muse Image在文生图榜单排第二,改变画图方式,能自我修正。它与Muse Spark打通,Muse Video文生视频排第3。不过,其@功能有隐私隐患。