图像自动着色模型」共找到 1015 篇相关文章

新闻资讯7

OpenAI o3-pro模型发布,但不能聊天

当地时间6月10日,OpenAI o3 - pro模型发布,ChatGPT Pro用户可通过API使用。它是o3子版本,在多领域表现出色,但响应慢,适用于对可靠性要求高的难题。目前临时聊天功能停用,不支持图像生成和Canvas。

AI前线
产品应用7

10万智能体同场模拟,YuLan-OneSim带来真正的大社会实验

YuLan-OneSim是大语言模型驱动的社会模拟器,能模拟人类社会行为。它可零代码构建场景,有50个默认场景,具分布式架构,支持10万智能体同场模拟,还推出AI社会研究员,自动完成社会科学研究流程。

带你学AI
产品应用7

我给剪辑产品 0 元雇了个外部研发部:它开始自进化

作者的剪辑产品有了“外部研发部”——Agent。它每天研究新方法、用真实项目测试。作者三步搭建此“研发部”,让其自动查询、测试和汇报,自己负责最终决策,项目获取新方法不再只靠偶然。

AI产品自由
开源动态8

Github 1.8k star Skyvern:AI直接接管鼠标键盘,3行API干掉你写了3年的脆弱XPath脚本!

Skyvern是开源AI浏览器代理,结合LLM和计算机视觉,自动执行浏览器业务流程。它用简单API复刻人工操作,替代传统脚本,解决脚本脆弱、流程复杂等痛点,功能丰富,技术优势明显,适合多业务场景。

小华同学ai
开源动态7

Gamma完美开源平替,输入主题一键生成专业PPT,配图排版全自动

做PPT耗时耗力,现有AI驱动PPT生成工具多为闭源SaaS服务。GitHub上的开源项目presentation-ai是Gamma的开源平替,输入主题可自动生成PPT,功能丰富,还给出安装部署步骤和使用场景。

开源星探
新闻资讯7

Poe:DeepSeek使用率下降50%,快手崛起、OpenAI暴涨

2025年春季,Poe发布AI模型使用趋势报告。DeepSeek使用率降超50%,OpenAI因文生图功能暴涨。文本、视频、推理、图像和音频5大领域中,各模型表现不一,如快手Kling家族、谷歌Imagen 3家族等有亮眼表现。

AIGC开放社区
开源动态8

国产AI视频炸了!SkyReels-V3三大功能重磅开源,1张图生成逼真视频

昆仑天工SkyworkAI团队开源多模态视频生成模型SkyReels-V3,它能在一个架构内搞定参考图像转视频、视频延长、音频驱动虚拟形象三大核心能力,超越主流商业模型,且真正开源。

新智元
算法论文7

ICLR 2025新成果:文档检索“降本增效”,从此“开挂”

传统文档检索系统处理视觉信息丰富的文档存在瓶颈,ColPali方法直接从文档页面图像生成多向量嵌入,简化流程、提高性能、降低延迟。ColQwen - Omni在其架构上扩展到图文+音频多模态匹配。

CourseAI
算法论文7

VQA高分是在看图,还是在记答案?ReKey只更新决定答案的那一小块

视觉问答模型准确率提升,但高分可能源于记忆。浙江大学等团队提出 ReKey,保留真实场景,只更新决定答案的视觉线索,使评测面向未见过内容,且多数环节可自动完成。

机器之心
新闻资讯7

确认!DeepSeek多模态AI已经开测

DeepSeek研究员陈小康、陈德里确认其V4视觉模式开始灰度测试。更新后出现识图模式,具备真实图像理解能力。陈小康是多模态研究组负责人,陈德里负责语言模型等核心方向,V4可谓满血归来。

量子位