「多风格图像」共找到 4528 篇相关文章
Soul App 又又又开源了!这次是实时交互数字人,支持小时级长视频甚至无限时长!
Soul App 新开源实时数字人项目 SoulX-LiveAct,解决 AR 扩散模型流式生成稳定性问题。它实现 20 FPS 实时流式推理,延迟 0.94 秒,支持无限时长,有恒定显存等亮点,可用于多场景。
IEEE TVCG | 告别写代码!MoGraphGPT:基于模块化大模型与图形控制的2D交互场景创作
香港多所高校研究团队提出 MoGraphGPT 系统,结合上下文感知模块化大模型与图形化控制,能让用户零代码搭建 2D 交互场景。该成果被 IEEE TVCG 录用,还对比实验验证其优势。
阿里财报暴跌7%,华尔街却集体喊买入——这里有个逻辑差
3月19日阿里发布2026财年Q3财报,股价跌7.3%。散户看到净利润暴跌、现金流为负,华尔街关注阿里云增长与AI潜力。文章分析财报,探讨钱去向、风险及投资决策。
OpenMAIC:一键生成互动课堂,视频+PPT全都有,还可以编辑
清华开源项目OpenMAIC是多智能体互动课堂,上传文档或描述主题,几分钟就能生成虚拟课堂,AI教授讲课、同学讨论,还有白板功能。底层用LangGraph编排,支持主流模型,有OpenClaw集成,架构完整。
OpenAI开除内鬼!拿着改变世界的机密去赌博,一夜狂赚几十万
OpenAI开除一名利用公司核心机密在预测市场下注牟利的员工。调查发现过去一年多,60个神秘钱包做出77次精准押注。不止OpenAI,其他预测市场平台也出现内幕交易案件,平台陷入尴尬处境。
谷歌AGI底座降临!首个原生全模态嵌入模型上线,已实现全模态SOTA
谷歌发布首个原生全模态 Embedding 模型 Gemini Embedding 2,将文本、图、音视频及 PDF 融于统一向量空间,实现跨模态检索,降低架构成本,赋予 AI 连贯「记忆」,是重塑 AI 基建的里程碑。
谷歌首个原生多模态向量模型发布:Agent 可以用文字搜图片、用图片搜视频了...
谷歌推出首个原生多模态嵌入模型Gemini Embedding 2,通过Gemini API和Vertex AI公开预览。它将文本、图像等映射到统一向量空间,支持多模态交错输入,性能超越现有领先模型,开发者可快速接入。
1美元Token撬动4800美元收益!AI挑战百万美元级基准,最赚钱的Agent出现了
Humanlaya Data Lab等机构构建$OneMillion - Bench评测基准,用经济价值衡量模型。它含400道高难题目,覆盖多领域。目前最强模型能产出约50万美元价值,但离可交付专业任务还有距离。
世界模型原生新一代范式!极佳视界斩获全球第一后,GigaBrain-0.5M*再进化
具身世界模型新一代原生范式登场,GigaBrain-0.5M*在多真实机器人任务中数小时零失误。它依托世界模型,创新引入人在回路机制,研发采用四阶段闭环训练流程,优势显著。
我用GLM-5肝出一个Rust版Agent系统,Opus 4.6迎来了最强开源对手。
作者实测智谱发布的GLM - 5后,用其开发出Rust版Agent系统并开源。还对比GLM - 5与Kimi 2.5、Opus 4.6,认为GLM - 5写后端能力强,让普通开发者也能用高级架构能力。