「图像分层生成」共找到 2541 篇相关文章
拒绝重复造轮子!抽象 80% 工作场景,打造可复用的"AI 助手工厂”
文章指出,为解决重复开发AI助手的效率问题,智空间团队将高频需求抽象为可复用技术方案,打造“AI助手生产线”。介绍四大高频场景本质、共性挑战及对应方案,还阐述分层架构、解决方案、prompt架构等,最终落地“助手工厂”产品。
Vibe Coding 有了,Vibe Design 呢?Lovart 让不会设计的人也能输出专业素材
作者用 AI 编程一年多,但标签页表情包提醒自己不是设计师。现有生图工具生成的 PNG 不能直接当 logo 用,而 Lovart 打通从 PNG 到 SVG 的路,让无设计知识的人也能输出专业素材。
30秒,我用蚂蚁灵光复刻了个支付宝(doge)
蚂蚁集团推出全模态通用AI助手灵光,最快30秒生成私人定制小APP,可编辑交互分享。实测其功能丰富且专业,实现多模态输出和多智能体协作。还对比了与千问区别,介绍蚂蚁AGI布局。
20美元,撕开人类思维鸿沟!宾大教授警告AI隐形阶层战
宾大教授Ethan Mollick指出,AI已成新社会基础设施,正制造人类内部分层。从免费到20美元、200美元,不同付费层级对应不同使用模式和能力,思维差异才是关键,未来需培养与AI协作的直觉。
Claude不让我们用!国产平替能顶上吗?
全球AI代码生成竞争格局生变,Anthropic地位动摇,一是OpenAI GPT - 5崛起,二是自身迷之操作。此时国产大模型发力,如Kimi - K2 - 0905、Qwen3 - Max - Preview,性能和价格有优势,有望改变竞争格局。
MIDAS:快手可灵发布实时交互式数字人生成框架
近年来交互式数字人视频生成受关注,但实时处理多模态输入有挑战。快手可灵团队提出MIDAS框架,基于LLM驱动的自回归模型,结合轻量级扩散头,实现低延迟、交互式多模态控制,还构建大规模数据集等。
是「福尔摩斯」,也是「列文虎克」,智谱把OpenAI藏着掖着的视觉推理能力开源了
智谱开源视觉推理模型 GLM-4.5V,还同步开源桌面助手应用。此模型视觉推理能力强,在图像识别、视频理解、前端复刻、图表处理等多方面表现出色,技术创新使其达开源 SOTA 水平,推动行业注重实用价值。
医疗AI平台Abridge获3亿美元,估值53 亿美元
医疗AI平台Abridge获3亿美元E轮融资,估值达53亿美元。其利用AI为医疗场景服务,核心功能“环境监听”可生成临床笔记。目前超150家医疗系统使用,正拓展收入周期管理等业务。
73%人类认同率!Video-Bench实现视频质量精准打分
上海交大等团队提出视频评估框架Video - Bench,让多模态大模型‘像人一样评判视频’。它构建双维度评估框架,引入链式查询和少样本评分技术,与人类判断73%高相关,为视频生成模型优化提供标尺。
Action Map Policy:从高维动作回归到像素分类,一种新的机器人操作学习范式
本文介绍美国东北大学博士生黄浩杰提出的全新机器人操作学习范式Action Map Policy(AMP),将高维三维机器人动作转化为二维图像空间的像素分类问题,性能和推理速度均显著优于现有主流基线方法。