图片生成式」共找到 2660 篇相关文章

算法论文8

NeurIPS 2025 Spotlight | FSDrive统一VLA和世界模型,推动自动驾驶迈向视觉推理

面向自动驾驶的多模态大模型存在问题,FSDrive提出“时空视觉CoT”,让模型“以图思考”,联合未来场景与感知结果进行可视化推理。该方法在不改动原有MLLM架构前提下激活图像生成能力,实验表现出色。

机器之心
算法论文8

让RAG真正读懂“言外之意”!新框架引入词汇多样性,刷新多项基准SOTA

ACL 2025研究提出Lexical Diversity - aware RAG (DRAG) 框架,将词汇多样性引入RAG检索与生成,解决现有方法痛点。它有两大创新模块,实验在多基准提升准确率,还将在多模型上增益,代码即将开源。

量子位
新闻资讯7

苹果秋季新品发布会,全系全面拥抱AI,比Pro还要Pro的iPhone Air已加购物车。

苹果秋季发布会如期而至,带来AirPods Pro 3、Apple Watch系列、iPhone系列新品。新品在AI功能融合上有进步,如AirPods的实时翻译与心率监测、Apple Watch的健康预警、iPhone的图片搜索与AI翻译等。

开源AI项目落地
新闻资讯7

刚刚,DeepSeek最新发文!V3/R1训练细节全公开,信息量巨大

网信办新规生效,DeepSeek回应,标注AI生成内容,公开V3/R1训练细节。介绍训练分预训练和优化训练,深挖数据使用,还谈及推理、开源情况,也提到对抗AI幻觉与滥用风险的措施。

新智元
产品应用8

百度用50天将视频价格打到行业70%!内部负责人:成本优化还有空间

8月21日百度蒸汽机音视频一体化模型重大升级,实现多人有声视频一体化生成。有五大核心技术突破,价格低至行业70%。源于算力和工程优化积累,未来还会优化成本,其盈利不依赖调用次数,带动平台生态升级。

AI前线
新闻资讯7

“憋屈” CEO出走GitHub!自曝在微软受限干不下去、被开发者骂蠢喊冤,或押宝Agent反攻老东家?

GitHub 首席执行官 Thomas Dohmke 宣布离职,之后将重新成为创始人。GitHub 将更全面融入微软组织架构,不再设单一领导者。Dohmke 任内升级 Copilot,但也面临功能被抱怨等问题,他还谈及 AI 发展方向。

AI前线
产品应用7

GPT-5 在 Lovable/Vibecode 中氛围编码,附 GLM-4.5 对比 (反向搜索引擎、吵架的俄罗斯方块)

文章展示GPT - 5在网页端、Lovable、Vibecode的测试案例,与GLM - 4.5对比。如GPT - 5在WebDev Arena创纪录,不同版本使用限制不同。还列举多个应用案例,指出GPT - 5有不足,GLM4.5全栈开发表现不错。

AI进修生
新闻资讯7

AI 的「成本」,正在把所有人都拖下水

文章指出,虽大模型成本下降,但 AI 公司仍难盈利。因市场追逐新模型,且模型消耗算力单位剧增。如 Anthropic 的不限量套餐失败,各公司陷入囚徒困境,还给出按使用量计费等破局思路。

AI科技大本营
新闻资讯7

Remix 3终结以React为中心的架构

多年来,React 一直是全栈 JavaScript 架构基础。但 Remix 3 挑战了这一局面,它遵循渐进增强和服务器优先原则,将 Web 基本原理置于核心,重新定义构建方,引发对 React 中心架构的思考。

InfoQ
新闻资讯7

对话AutoCoder宿文:做5000万程序员的AI IDE,不如做10亿软件消费者的Vibe Coding

2025年AI Coding赛道火热,大厂纷纷布局。AutoCoder创始人宿文认为不应与大厂卷辅助编程,要走出差异化,做面向10亿软件消费者的Vibe Coding。团队迭代代码模型,产品数据表现佳,还分享了创业、产品、市场等多方面看法。

鲸选AI