「多模态图像生成」共找到 3065 篇相关文章
GPT-4o连验证码都解不了??SOTA模型成功率仅40%
MetaAgentX团队推出Open CaptchaWorld平台,用于测试Agent解验证码能力。实测SOTA多模态模型成功率低,如GPT - 4o也被难住。该平台特点多样,揭示了当前Agent短板及模型设计新方向。
用DeepSeek徒手造一个能对话的AI简历,助你当场拿下Offer。
作者招人时收到很多AI生成简历,有份把自己变成含AI对话的可视化简历脱颖而出。作者分享用Dify+Gemini或DeepSeek+YouWare搭AI简历方法,还以马斯克求职为例演示操作步骤。
华为攻克AI推理「想太多」问题!新方法让大模型推理提速60%,准确率还高了
华为提出高效推理方法S - GRPO,突破思维链「冗余思考」瓶颈。通过“串行分组 + 衰减奖励”设计,在Qwen3上有效,推理提速60%,生成答案更精确有用,在多个推理benchmark测评中表现出色。
中国团队让AI拥有「视觉想象力」,像人类一样脑补画面来思考
上海交通大学等团队提出 Thinking with Generated Images,让大模型像人类一样用「脑内图像」推理。该研究区分三种视觉思维模式,提出核心技术框架,解决视觉推理局限,实验效果好,未来有望在多领域突破。
Meta CEO X 微软 CEO 对话解读:「蒸馏工厂」为何成为开源的魅力之源?
Meta CEO Mark Zuckerberg 和微软 CEO Satya Nadella 在 LlamaCon 2025 闭幕会议对话,探讨AI对技术平台等影响,如使文档、应用和网站界限模糊,还谈及开源与闭源模型战略价值及‘蒸馏工厂’概念。
13K star!这个项目太顶了,自动化 API,后台作业,工作流,UI开发,低代码一网打尽!
日常开发构建和管理内部工具费时费力,第三方方案费用高。开源项目Windmill是开发者福音,能将脚本自动转换成工作流程和UI,适用多场景,有自动UI生成等特色,安装使用简单。
ICML 2025 | 如何在合成文本数据时避免模型崩溃?
随着生成式AI发展,合成数据成大模型训练重要部分,但可能引发“模型崩溃”。ICML 2025会议上,上交大等团队剖析此问题,提出Token - Level Editing策略,避免模型崩溃,实验验证了其有效性。
GPT-6 Sol要来了?OpenAI本周或迎「发布狂潮」
本文爆料OpenAI核心人员预告本周将迎来DevDay级别的大规模产品更新,网传GPT-6 Sol已进入灰度测试,OpenAI正推动旧模型迁移,本轮更新覆盖新模型、多模态、智能体等多个领域。
智能体请求暴增 9.4 倍,token 账单却没涨:Uber 公开 AI 软件工厂省钱方法
Uber AI已嵌入软件开发全流程,超70%代码合并请求由智能体生成,半年内智能体请求暴增9.4倍,通过多项优化实现AI总支出稳定,本文公开其整套AI降本方法论。
具身智能发展趋势与展望 | 中国工程科学
文章深入探讨具身智能的概念、内涵、计算框架与系统实现,梳理发展现状、趋势与挑战,强调生成式AI在其演进中的关键作用,还分析我国发展进展、风险,并给出研究方向与对策。