「实时编辑」共找到 566 篇相关文章
谷歌Gemini火力全开!实测:原生图像生成新升级确实强
谷歌Gemini原生图像生成功能升级,图像质量更好、文本渲染更准、生成速度更快。可融合图片元素、实时编辑等,能免费试玩,开发者可集成API。实测表现惊艳,也有翻车情况,还能搭配Gemini 2.5 Pro。
OpenAI点赞转发的冠军项目,背后藏着一个国人3D生成团队
近日,iOS产品StoryWorld获OpenAI Codex Hackathon冠军,其核心3D资产生成用了DeemosTech的Hyper3D Rodin。从黑客松到英伟达工程场景,3D生成重稳定性等特性。Hyper3D团队技术强,发布编辑功能,推动3D生成走向可控。
飞书合作的第一款AI硬件来了,居然是个AI录音豆。
飞书与安克创新合作推出首款AI硬件——AI录音豆。该产品小巧便携,可夹在衣服或吸附金属上,有飞书生态,录音质量好,自带底噪抑制,录音后能自动同步云端,快速生成会议纪要,还支持实时翻译。
中文版Nano Banana来了?Qwen-Image-2.0炸场:1K长文本硬吃,中文生图彻底不拧巴了
AI生图曾有文本长易糊、指令复杂就出错、中文渲染差等问题。阿里新发布的Qwen-Image-2.0能处理1K token长文本,理解复杂指令,中文渲染佳,还能多图编辑,国际评测表现也靠前,阿里云百炼已开通API邀测。
TDSQL Boundless:AI时代的多模态数据库
在AI与数据分析处理技术融合的当下,传统数据库架构面临诸多挑战。腾讯云TDSQL Boundless推出,通过统一架构处理多模态数据。本文从核心架构、关键技术特性及对未来数据平台建设的启示三方面解读。
超越Runway!Adobe发布新神器:P视频比P图还简单
Adobe联合多高校推出AI模型EditVerse,它将图片和视频编辑整合,解决传统视频编辑复杂、数据稀缺问题。通过通用视觉语言、上下文学习能力和知识迁移,其效果超Runway,还展现涌现能力。
出自小米的模块化图像编辑改造:让 AI 学会「搭积木」
小米研究团队发布 Lego-Edit 图片编辑框架,将复杂编辑任务拆成工具集和调度系统,工具集模型各司其职,调度系统指挥操作。采用渐进式训练,性能优、扩展性好,体现协同智能优势。
AI生图迎来大升级:图像编辑达到像素级!背后团队大多来自Stable Diffusion模型基础技术发明团队
Stable Diffusion缔造者团队创立的 BFL 发布全新图像生成模型 FLUX.1 Kontext,可实现像素级图像编辑。它能以文本和图像为输入,有 Pro、Max、Dev 三版本,已在多平台上线,获用户好评,但也面临竞争。
Seedream 4.0大战Nano Banana、GPT-4o?EdiVal-Agent 终结图像编辑评测
在AIGC下一阶段,图像编辑成检验多模态模型关键场景。研究者提出EdiVal - Agent评估框架,能自动化生成指令并多维度评估编辑结果,其评估与人类判断一致性高,还对比了13个模型的多轮编辑表现。
刚刚,机器人练成了宁次的「白眼」:∞帧画面边看边3D重建我们的世界!
蚂蚁灵波开源的LingBot - Map模型实现无尽流,可看∞帧视频稳定实时3D重建。它打破“既要实时、又要记路、还要省显存”的不可能三角,在多项测试中表现优异,补齐具身智能关键拼图。