图像定制」共找到 621 篇相关文章

产品应用8

Meta首个Agent生图模型登场,空降竞技场第二

Meta超智能实验室推出图像生成模型Muse Image,引入智能体机制,能编写代码、网络搜索,有自主修正能力,支持算力扩展、多轮编辑与画面合成。还预览了Muse Video,两模型均与Meta产品深度整合。

AI寒武纪
新闻资讯8

Altman 亲自坐镇发布 ChatGPT Image 2,小编实测:风格、画质、叙事感全都夯爆了

OpenAI CEO Sam Altman 亲自发布 ChatGPT Images 2.0,这是该公司迄今功能最强的图像生成模型。它有思考能力,可直出 8 张连贯图片,支持多语言、多种画幅与分辨率,能精准执行复杂指令,直接商用也没问题。

InfoQ
算法论文8

多模态幻觉的病因「高熵节点」找到了!全基准幻觉率下降

多模态大推理模型的幻觉常出现在生成转折词时,此时模型处于高熵关键节点,易脱离图像证据。研究者提出LEAD,高熵时保留候选推理方向,注入视觉锚点拉回证据,实验显示它能跨领域提升模型性能。

新智元
开源动态8

告别直接生成,文生图进入Agent时代:港中文联合伯克利开源Gen-Searcher

过去文生图多是‘直接出图’,遇真实世界知识等易翻车。港中文等团队提出Gen - Searcher,让图像生成模型像Agent一样搜索等,数据、模型和代码均已开源,实验显示它提升了生图准确性和质量。

机器之心
产品应用8

Google Gemini Embedding2:一个模型处理所有媒体类型

Google发布Gemini Embedding 2,首个原生多模态嵌入模型。能处理文本、图像等多种媒体类型,支持交错输入,覆盖超100种语言。与多模型串联方案比,延迟降70%、召回率升20%。已可在Gemini API等使用。

AI工程化
8

陶哲轩对谈 OpenAI 高管:“试错成本”无限趋零,AI 正在把数学变成一门重工业

菲尔兹奖得主陶哲轩与OpenAI顶尖科学家Mark Chen对谈,探讨AI在数学研究中的能力、缺陷与演化路径。指出AI试错成本低,在数学领域发展潜力大,虽目前有局限,但正改变数学研究方式。

AI科技大本营
算法论文8

让大模型上车:理想汽车硬件协同设计算出最佳边缘模型

长三角洲AI实验室、中科院、理想汽车等找到大语言模型硬件协同设计寻优之路,在相同延迟下降低端侧模型困惑度,压缩模型架构挑选时间。研究揭示缩放定律,打造硬件感知建模框架,找到精度与延迟最优解。

AIGC开放社区
新闻资讯8

奥特曼承认OpenAI路线走偏了,以及“写代码将变得不再重要”

奥特曼在直播中给出诸多实诚结论,如未来工程师人数或大幅增加,写代码时间将减少,OpenAI搞砸ChatGPT5系列模型,后续会回归通用模型,还探讨了AI对教育、经济、安全等方面的影响。

量子位
推荐文章7

Agent总 “掉链子”?它只是缺这 4 项外挂必备技能

Anthropic工程师团队揭秘给智能体定制技能包,解决现实问题。Anthropic总结智能体在现实任务中目标模糊、步骤混乱等短板,针对性设计任务拆解、状态感知等4大核心技能,让其扎根现实搞定复杂任务。

CourseAI
算法论文8

全图与切片并非等价?LLaVA-UHD-v3揭示差异推出高效全图建模方案

随着多模态大模型发展,处理高分辨率图像成关键。主流视觉编码范式难兼顾性能与效率,清华和中科院团队发布 LLaVA-UHD v3,提出 PVC 框架,对比 SBE 和 GNE,验证其在提升效率同时保留模型能力。

机器之心