多模态图像生成」共找到 3049 篇相关文章

开源动态8

一天斩获2.5k星星!首个可以「让AI直接画CAD」的开源项目来了

新开源项目text - to - cad很猛,只需把需求告诉AI,它就能生成可编辑3D模型、导出文件,还能预检。支持多格式,有几何引用等特点,一天获2.5k星。

开源AI项目落地
开源动态8

打破碎片化瓶颈!浙大&哈佛开源UniGeo,高保真相机可控编辑

当前主流相机可控图像编辑基于图像扩散模型,应对连续相机运动易出现问题。近日,浙大联合哈佛发布UniGeo框架,在三核心层面注入统一几何引导,克服结构退化,提升视觉质量与跨视角一致性。

新智元
推荐文章8

从实践到原则:为 AI Agent 构建的 Harness Engineering 落地与探索

生成式 AI 进入软件开发核心流程,但 AI 写代码速度超团队控复杂度能力。问题不在模型,而在软件工程系统。Harness Engineering 试图解决此问题,从三层面重新设计工程系统,已有公司实践。

phodal
算法论文8

JustGRPO:扩散语言模型的极简主义回归

本文提出回归极简的方法 JustGRPO,在 RL 阶段让模型自回归生成,用标准 GRPO 训练,能超越各类针对 dLLM 设计的 RL 算法表现,提升推理表现同时保留并行解码能力。

机器之心
新闻资讯7

大模型低价趋势延续!智象未来姚霆:B端、C端界限模糊,API不够、逼出 “按结果付费”

InfoQ 采访智象未来联合创始人姚霆,探讨多模态大模型发展。他指出深度 Scaling up 收益放缓,广度 Scaling up 有惊喜;2025 年模型价格战倒逼厂商加速,低价趋势 2026 年将延续,商业模式转向“按结果付费”。

InfoQ
开源动态7

11K+ Star!NotebookLM 最强开源平替来了,支持私有化部署!

NotebookLM好用但有数据隐私问题,GitHub上的SurfSense是其开源平替,支持私有化部署。它功能成熟,支持多种文件格式等,提供三种入门方式,虽缺PPT生成能力,但知识管理和问答功能够用。

开源星探
推荐文章8

大型语言模型正在掏空和填满你的钱包

人工智能改变赚钱和花钱方式,生成式AI每年或为全球经济增2.6 - 4.4万亿美元。文章介绍LLM在多领域应用,如客服降成本、内容创作提效率等,企业应积极拥抱技术革命。

AIGC开放社区
新闻资讯8

请回答2026:38位中国AI关键人物的Magic Moment和趋势判断|甲子光年

甲子光年与38位中国AI关键人物对话,总结2025年Magic Moment,展望2026年技术趋势。2025年是中国AI关键年,2026年大家不再聚焦大模型,更关注多模态、智能体等‘系统级智能’突破。

甲子光年
新闻资讯7

离职程序员深夜忏悔用“绝望指数”算法害人:Uber Eats剥削外卖员让缺钱者狂接垃圾订单!如今竟被爆帖子是AI编的?网友:别再让AI背锅了

Reddit一用户自称Uber Eats离职工程师,爆料平台用“绝望指数”算法剥削外卖员,帖子传播极广。但记者核实发现是编造,“证据”或由AI生成,网友对此调查结论看法不一。

AI前线
新闻资讯8

深扒ICLR「泄露门」:AI学术历史上最魔幻的61分钟,或许没有之一

2025年11月27日,ICLR 2026发生严重安全事故,超1万篇论文评审信息泄露。攻击者利用OpenReview API漏洞获取信息,引发轩然大波。此外,Pangram Labs报告显示21%审稿意见为AI生成,暴露出学术评审诸多问题。

新智元