「AI视觉生成」共找到 11073 篇相关文章

开源动态8

DeepSeek又拿第一!首创「因果流」视觉推理,超越Gemini

DeepSeek开源DeepSeek - OCR2,引入DeepEncoder V2视觉编码器,打破传统模型扫描限制,模仿人类视觉「因果流」逻辑。它解决了传统VLM忽略图像语义结构问题,在多项测试中表现出色,还验证了「LLM作为视觉编码器」可行性。

新智元
推荐文章7

分享6个平时我最常用的Prompt心法。

作者作为常靠AI帮忙的普通用户,分享6个与AI对话的心法技巧。包括让AI选角色回答、回答前追问、与AI辩论、预演失败、反向推提示词和双层解释法,助大家与AI有效协作。

数字生命卡兹克
算法论文8

设计师大解放!清华发布「建筑平面图」自动生成模型 | ACL'25

清华大学吕帅团队提出FloorPlan-LLaMa模型,采用自回归生成架构与RLHF机制,解决传统平面图自动生成模型‘指标优秀但实际不可用’痛点,提升生成式平面图设计质量与实用价值。该论文被ACL录用获领域主席奖。

新智元
算法论文8

比Sora更疯狂!英伟达AI让机器人「做梦」修炼,无师自通直接上岗

英伟达新研究项目DreamGen用视频生成模型让机器人在神经网络生成的「梦境世界」自主探索学习。它能让机器人掌握新动作、泛化到新环境,合成数据暴涨333倍,还引入DreamGen Bench用于视频生成基准。

新智元
8

刘壮陈丹琦新作:开源通用视觉推理RL框架,0思考数据刷新SOTA

普林斯顿刘壮团队、陈丹琦参与推出开源通用视觉推理RL框架Vero。它构建的视觉推理器在30多项测试达8B视觉语言模型SOTA,解决了开源RL方案的问题,所有数据、代码、模型均已开源。

量子位
推荐文章8

AI赛博活佛Andrej Karpathy最新访谈:我学到了他最核心的思维方式

10月17日的Dwarkesh播客访谈里,AI科学家Andrej Karpathy分享思维方式、对AI发展的思考及做AI教育的思路。他用“一阶项”思维抓核心,教学先让学生经历问题,还提出知识可能拖累模型等观点。

花叔
新闻资讯7

面向 AI Agent 的搜索服务,小宿科技有机会成为百亿美金的新巨头吗?

文章围绕AI搜索展开,分析微软Bing停用API原因,探讨小宿科技做Agent时代AI搜索服务的机会。从多方面剖析小宿优势,如全球通能力、贴合需求打法等,指出AI时代搜索是B端基建博弈。

Founder Park
新闻资讯7

吴恩达来信:Buildathon 快速工程挑战赛正式发布!

2025年8月16日将在旧金山湾区举办Buildathon快速工程挑战赛。AI辅助编程重塑软件工程,不同开发者对AI使用程度差异大。DeepLearning.AI与AI Fund携手举办竞赛,让选手限时构建产品。

DeeplearningAI
新闻资讯7

模力工场 025 周 AI 应用榜:传统SEO黄昏?蓝莺 GrowAI 说让品牌出现在 AI 答案里!

模力工场第 025 周 AI 应用榜揭晓,8 款应用上榜,涵盖营销、效率、设计等多领域。蓝莺 GrowAI 成榜首,其开发者分享构建经验,还谈 AIGC 对 SEO 影响等问题。此外介绍上榜机制与参与方式。

AI前线
新闻资讯7

马斯克:2036 年,钱将不再重要。

马斯克在《经济学人》访谈节目中表示,2036年AI将远超人类智能总和,迎来富足时代,钱将不再重要。他还预测未来通缩,AI将替代多数工作,也提到AI安全监管、中美AI约束因素等。

AGI Hunt