「多模态程序合成」共找到 1314 篇相关文章
腾讯Omega:下一代“AI BI”的答案?
本文介绍腾讯 Omega,它是为解决传统 BI 和 ChatBI 问题而设计的数据分析产品。Omega 能理解业务问题,生成完整 Dashboard,确保数据流动、安全和稳定,还支持人机协作,提供审美基础设施,性价比高,有完善运行时和监控推送等功能。
现在,你可以在手机上用AI生成一个APP了。
作者参加百度Create 2026 AI开发者大会,介绍百度秒哒。它是能帮开发产品的Agent,虽与顶级产品有差距,但全链路适配、对国内生态友好。大会上线APP版,能直接生成安装包,操作简单,解锁普通人创造力。
《动手写AI Agent》前言 · 先看完成品
作者因想搞懂 Agent 原理,且市面上缺系统学习资料,决定手写一份教程,即《动手写 AI Agent》。书中 Ling 是从零手写的编程助手,介绍了其 8 个应用场景、技术规格,还说明了适合读者与全书路线图。
硅谷亲手砸掉自己饭碗?930万岗位正进入AI风险区
Tufts大学发布全美首个「AI就业风险指数」,显示未来2 - 5年,美国约930万个岗位面临被AI替代风险,硅谷等科技重镇首当其冲。高技能、知识密集型职业风险高,而低薪职业相对安全。
刚刚,全球视频模型新王诞生了!
天工AI的SkyReels-V4直接登顶Artificial Analysis文转视频全球榜,超越Veo 3.1、Sora 2。其相比之前有两大核心升级,让视频生成从‘生成片段’走向完整视频生产,还应用于短剧平台DramaWave。
CVPR 2026 | 还在为AI「鬼画符」发愁?TextPecker即插即用破解文字渲染难题
在生成式AI浪潮中,视觉文本渲染仍是未攻克的核心难题。华中科技大学白翔教授团队等提出TextPecker,是基于结构感知的即插即用型强化学习优化策略,可适配主流生成器,提升视觉文本渲染性能,已被CVPR 2026接收。
字节开源GUI Agent登顶GitHub热榜,豆包手机核心技术突破26k Star
字节开源的豆包手机核心支撑GUI Agent模型UI - TARS登顶GitHub热榜,突破26k Star。它是多模态AI智能体,纯视觉驱动,部署简单,历经多轮迭代,成为热门开源多模态Agent。
在参与OpenAI、Google、Amazon的50个AI项目后,他们总结出了大多数AI产品失败的原因
Aishwarya Naresh Reganti 和 Kiriti Badam 参与超50个企业级AI产品构建。他们指出,如今AI产品构建成本降低,但多数仍失败。还分享开发陷阱与路径,如从低自治高控制起步、建立CC/CD框架等,也对AI未来发表看法。
美团智能体SOTA模型LongCat-Flash-Thinking-2601开源
美团龙猫团队开源智能体推理模型LongCat - Flash - Thinking - 2601,总参数5600亿。该模型在多方面有卓越表现,团队通过构建数据、模拟环境、采用强化学习策略及设计高效架构等,使其比肩闭源模型。
LLM时代的事件抽取:从静态任务到认知脚手架
此综述论文探讨LLM时代事件抽取价值,认为其未被削弱,应视为“认知脚手架”。它系统梳理任务分类、方法演进等,还提出六大未来研究方向,指向将其演化为智能感知与记忆层。