图片开口」共找到 171 篇相关文章

产品应用7

别难为 ChatGPT 了!面对海量资料,NotebookLM + Gemini 的“外挂模式”才是降维打击

Google打通NotebookLM和Gemini后,二者协作效果出色。NotebookLM可拆解复杂信息,Gemini以其为参考数据源答案更精准。二者还能基于笔记本做网站、视频、图片等,各有优势、双向协作。

AI进修生
产品应用8

超越Runway!Adobe发布新神器:P视频比P图还简单

Adobe联合多高校推出AI模型EditVerse,它将图片和视频编辑整合,解决传统视频编辑复杂、数据稀缺问题。通过通用视觉语言、上下文学习能力和知识迁移,其效果超Runway,还展现涌现能力。

新智元
产品应用7

AI生的图能分图层,Agent控制能力进入下半场

Lovart上线Layered Image Editing功能,可自动识别图片里的文字、主体、背景并拆成独立图层,每个图层能单独编辑。其还有快速模式,模型库更新快,能降低AI生图门槛。

探索AGI
开源动态8

本周 5 个超酷 GitHub 开源项目,实用到飞起!

本文介绍本周5个超酷GitHub开源项目。有显示苹果设备电池状态的AirBattery,开源卫星可视化平台keeptrack.space,本地图片压缩工具Pic - Smaller,跨平台端口助手Port - Killer,轻量级AI证件照工具HivisionIDPhotos。

开源先锋
开源动态8

看看人家的项目,一行命令即搞定,优雅、好看!

开源君发现神器 Freeze,它由 Charm 团队开发,能将代码文件或终端输出渲染成图片,支持多格式、高度定制,有交互界面,在 GitHub 获 4.4k Star,适合写博客、做分享的人。

开源先锋
新闻资讯7

我在OpenAI修中文

OpenAI研究科学家陈博远介绍GPT Image 2官网博客花絮,分享模型训练、测试情况,还展示亲手制作的官网图片,包括中文彩蛋、漫画、杂志页等,体现模型文字渲染、视觉推理等能力。

机器之心
新闻资讯7

GPT Image 2研究科学家陈博远:我在OpenAI修中文

GPT Image 2发布引发AI圈震动,主力训练者陈博远分享幕后故事。他和奥特曼同台主持,修好中文渲染,给模型起代号“布基胶带”,还设计多种“彩蛋级”测试,抖出官网图片幕后花絮。

量子位
算法论文8

视频扩散模型新突破!清华腾讯联合实现高保真3D生成,告别多视图依赖

清华大学联合腾讯提出Scene Splatter,基于视频扩散模型,从动量视角引导其生成满足三维一致性的视频片段,提升三维场景生成效果,解决了传统方法在单张图片重建三维场景的难题。

量子位
开源动态7

离谱!我以为 OCR 还在一页页抠字,结果百度 1.2 万 Star Unlimited-OCR 直接把长文档一口气读完

百度开源的Unlimited - OCR项目目标是处理图片、长文档等资料,将其转化为Markdown等结构化结果。它提供多入口,解决传统OCR处理长文档的问题,有多种应用方向,但也有边界。

小华同学ai
算法论文8

AI玩拼图游戏暴涨视觉理解力,告别文本中心训练,无需标注的多模态大模型后训练范式

在多模态大模型后训练浪潮中,现有方法多以文本为中心。MMLab@南洋理工大学提出Visual Jigsaw,将拼图任务用于后训练,让模型不依赖标注强化视觉感知与理解,在图片、视频和3D模态验证有效。

量子位