「图像理解与生成」共找到 2974 篇相关文章
视觉语言模型“扫地僧”:360低调开源FG-CLIP2登顶29项全球基准测试 | 甲子光年
两周前,360人工智能研究院低调开源FG - CLIP2,它在29个公开基准测试中超越Google和Meta的模型。该模型实现局部细粒度识别和原生双语对齐,为AI视觉理解设新基准,已服务开发者并在多领域落地。
从全局到部件:腾讯全新开源Hunyuan3D-Part和Omni
腾讯全新开源Hunyuan3D - Part和Omni。Hunyuan3D - Omni支持多模态输入,统一信号到跨模态架构提升融合鲁棒性。Hunyuan3D - Part含P3 - SAM和X - Part,分别用于部件分割与生成,在对应领域达先进水平。
超越GPT-4o和Gemini 2.5!小米MiMo-Audio音频大模型真香
小米推出MiMo - Audio大模型,预训练数据超1亿小时。它在多个基准测试成开源7B模型SOTA,开放相关资源。分词器表现佳,有全新架构,在音频理解、对话、推理等方面表现出色,还集成TTS功能。
千问App敞开玩,做红楼梦人物图、旅行海报、绘画书法无敌,顶级AI生图模型加持
作者体验阿里发布的Qwen - Image - 2.0模型后分享千问App玩法。可生成趣味信息图,如表情包、旅游攻略图、美食攻略图等;能做复杂文字梗图;还能创作中华文化传播图,如红楼梦解读图、手办图等,该模型懂中文意境。
Claude两个新模型实测流出!空间推理封神,算力直接榨干了
Claude两款新模型“棉花糖”和“甜瓜”实测流出,在3D强化学习和建筑空间布局上性能强大,还能直接理解并生成复杂3D坐标和空间关系。它们对算力吞噬疯狂,引发对其身份的猜测。
比英伟达早,比李飞飞强,大晓Kairos原生一体化世界模型定义物理AI新路线
大晓机器人发布 Kairos 开悟世界模型,其首创“多模态理解 — 生成 — 预测”原生一体化架构,采用跨具身渐进式训练体系和“以人为中心”的数据金字塔,还实现端侧部署,在四大权威具身智能基准上全面登顶。
智能体安全如何保障?首个企业级AI Agent应用评估标准欢迎共同起草
近期OpenClaw走红,AI智能体从“能理解、能生成”走向“能执行、能协作”,但企业面临智能体上线条件判断难题。智合标准中心组织起草《企业级AI智能体应用效能评估规范》,现公开征集起草单位与起草人。
刚刚,智谱和华为搞波大的:中国首个国产芯片训练出的SOTA多模态模型!
智谱与华为合作开源新一代图像生成模型GLM-Image,是中国首个全程用国产芯片训练的SOTA多模态模型,擅长文字渲染,拿下多项榜单第一,API调用一张图只要0.1元,还解析了其技术架构。
马斯克想要「杀死」氛围编程,就像FSD搞定自动驾驶
马斯克在X平台称xAI将消除氛围编程,让它回归纯粹编程,能按描述制作应用。氛围编程借助AI根据自然语言指令自动生成代码,若xAI愿景成真,软件开发范式或转变,程序员工作模式也将改变。
PyTorch博客翻译 Accelerating Generative AI Part III: Diffusion, Fast
这篇博客介绍用纯原生 PyTorch 技术将文本到图像的 diffusion 模型(特别是 Stable Diffusion XL)推理速度提升高达 3 倍的方法,讲解五种优化技术,还验证了方法在其他 diffusion 模型上的通用性和有效性。