「双语文本理解」共找到 1205 篇相关文章
Memvid:把你的文档库变成一个小巧的视频,还能瞬间搜出你想要的!
传统向量数据库因高成本和复杂运维让开发者却步。开源项目Memvid将文本数据存入视频文件,能高效检索,解决存储冗余、检索延迟和网络依赖问题,使用简单,虽处概念原型阶段但值得尝试。
MIT给微型机器人做了颗芯片,功耗仅6毫瓦,能实时3D建图
麻省理工学院研究团队开发出名为 Gleanmer 的微型芯片,功耗仅 6 毫瓦,能实时生成三维占据地图。它解决了机器人导航核心问题,通过多项优化提升性能,或让小设备拥有空间理解能力。
「香蕉革命」首揭秘!谷歌疯狂工程师死磕文字渲染,竟意外炼出最强模型
谷歌最新图像模型nano banana横空出世,能融合图片、理解地理等结构,实现多轮创作。它凭借Gemini知识与交错生成技术,重塑AI图像生成边界。谷歌团队揭秘其技术,还谈及未来发展方向。
纯靠“脑补”图像,大模型推理准确率狂飙80%丨剑桥谷歌新研究
剑桥、伦敦大学学院和谷歌团队推出基于强化学习的视觉规划(VPRL)新范式,纯靠图像推理。新框架利用GRPO后训练,准确率达80%,超文本推理至少40%,代码已开源。
Poe:DeepSeek使用率下降50%,快手崛起、OpenAI暴涨
2025年春季,Poe发布AI模型使用趋势报告。DeepSeek使用率降超50%,OpenAI因文生图功能暴涨。文本、视频、推理、图像和音频5大领域中,各模型表现不一,如快手Kling家族、谷歌Imagen 3家族等有亮眼表现。
深度拆解,硬核解构,揭开vLLM推理系统实现高效吞吐的秘籍
文章深度拆解 vLLM 推理系统,介绍其核心组件和高级特性,包括推理引擎流程、调度机制、高级功能等,还提及系统扩展、分布式部署、性能测量等内容,助力读者理解推理引擎工作原理。
Meta开源首个320亿参数代码世界模型CWM
Meta FAIR发布320亿参数的研究模型Code World Model (CWM),用“世界模拟”方式处理代码,试图真正“理解”代码逻辑。它在Math - 500数据集测试成绩亮眼,模型权重开放,可多渠道下载。
开源版MetaQuery来了!OpenUni用1.1B参数媲美BLIP3-o-8B,数据代码完全开源
南洋理工大学 S-Lab 和商汤科技团队推出开源版 MetaQuery——OpenUni,仅 1.1B 参数达 8B 模型性能,代码、权重、数据全开源。它架构极简、参数高效,还继承了多模态理解能力。
确认!DeepSeek多模态AI已经开测
DeepSeek研究员陈小康、陈德里确认其V4视觉模式开始灰度测试。更新后出现识图模式,具备真实图像理解能力。陈小康是多模态研究组负责人,陈德里负责语言模型等核心方向,V4可谓满血归来。
阿里又上新!开源 7B 文生图模型,专治图中文字,效果媲美 20B+ 大模型!
阿里 AIDC - AI 团队开源 7B 参数文生图模型 Ovis - Image,主打图中文字生成。它文本渲染能力强,在权威榜单成绩好,媲美 20B + 大模型,官方还提供使用方法,是设计类刚需模型。