「多模态创作」共找到 1239 篇相关文章
腾讯混元开源AI绘画新框架:24维度对齐人类意图,让AI读懂复杂指令
腾讯混元团队开源PromptEnhancer框架,通过“思维链提示重写”提升AI绘画文本 - 图像对齐精度,复杂场景准确率提升17%以上。还开源高质量基准测试数据集,为研究提供支撑。
全球百万网友迷上赛博「养鱼」,我也被这群AI小丑鱼拿捏了
Draw A Fish是一款AI小游戏,让全球百万网友上头。玩法简单,在画布画鱼,达到一定相似度就能放虚拟鱼缸。它门槛低、有成就感和互动性,背后是基于PyTorch的卷积神经网络,用ResNet18架构和QuickDraw数据集训练。
首个开源多模态Deep Research智能体,超越多个闭源方案
首个开源多模态Deep Research Agent登场,整合多种工具并优化决策。其WebWatcher技术方案覆盖全链路,实验中在四大核心领域领先主流模型,展现复杂推理和信息检索实力。
大型语言模型稳定强化学习的新路径:几何平均策略优化GMPO
本文介绍了大型语言模型稳定强化学习新路径——几何平均策略优化GMPO。它是GRPO稳定化版本,通过优化几何平均替代算术平均,解决GRPO训练不稳定问题,在多任务实验中显著优于GRPO。
亿万打工人在用的WPS,未来可能要重塑你的工作流
WAIC上,金山办公发布WPS AI 3.0及原生Office办公智能体WPS灵犀。WPS知识库解决文档管理难题,WPS灵犀功能全面,能深入办公场景,还推动AI办公向Agentic Software演进。
让小爱音箱超越「指令-响应」模式,开启真正智能交互新时代
2017年智能音箱诞生,却被困于「指令 - 响应」模式。此次Open - XiaoAI进化,接管小爱音箱“耳朵”和“嘴巴”,通过多模态大模型和AI Agent释放其潜力,还给出项目运行教程等。
腾讯混元AI开源3D世界生成模型!文图即可生成3D沉浸式场景!
腾讯混元AI实验室开源HunyuanWorld 1.0,这是业界首个支持沉浸式、探索性和交互性3D世界生成的全开源模型。它能通过文图生成3D场景,为多领域提供支撑,还给出安装和代码使用示例。
谷歌让机器人「长脑子」了!首发离线具身VLA模型,断网精准操控
谷歌首发具身智离线模型Gemini Robotics On-Device,实现VLA多模态大模型在具身机器人本地离线运行,无网络也能稳定运行。谷歌还开源了SDK,具身智能迈向实用化新阶段。
爆款AI视频越来越多,但本质我觉得跟炒股没区别。
作者以AI视频爆款频出为背景,借唐朝张大麻、自身炒股经历等故事,探讨AI视频爆款复制价值、获流量人数及流量后续价值,指出创作应重持续经营,勿盲目跟风。
刚刚,谷歌AI路线图曝光:竟要抛弃注意力机制?Transformer有致命缺陷!
谷歌未来AI路线图曝光,Gemini全模态是重点,模型向智能体转变,推理能力将扩展。谷歌还需突破现有注意力机制限制实现无限上下文。此外,文中盘点了OpenAI、DeepSeek等大厂AI年中表现。