能碳产业大模型」共找到 10431 篇相关文章

开源动态7

SGLang|SGLang Diffusion

来自SGLang开源社区的Yichi介绍SGLang Diffusion,它是面向图像与视频生成的全开源扩散模型推理引擎。基于SGLang机制将力迁移到扩散模型推理,显著提速工作流,视频展示了多种功

GiantPandaLLM
算法论文8

OmniHuman-1.5:让数字人拥有“思考”的视频生成新范式

现有视频数字人模型难捕捉角色本质,字节提出 OmniHuman - 1.5 框架。其核心创新是用 MLLM 提供语义引导、提出多模态 DiT 架构和伪末帧设计,使模型融合多模态信号,生成高质量角色动画。

带你学AI
开源动态8

3.2K Star!这个开源字幕神器,对剪视频的创作者来说,救了大命!

视频创作中字幕制作耗时费力,剪映等工具各有局限。开源字幕工具 AutoSubs 有效解决痛点,可一键生成高质量字幕、自动区分说话人,本地运行保障隐私,还具备多种亮点功,使用简单。

开源星探
开源动态8

抖音&LV-NUS开源多模态新模,以小博大刷新SOTA,8B推理比肩GPT-4o

抖音SAIL团队与LV - NUS Lab联合推出多模态大模型SAIL - VL2,以中小参数规模在106个数据集实现性突破。该模型从架构、数据、训练三方面创新,后经全链路优化,在多数据集验证中表现卓越。

量子位
新闻资讯8

UCSD谢澎涛创业:用AI搞科研,4小时交付顶刊水平成果,已获数百万美金融资

谢澎涛团队推出面向AI for Science的AIBuildAI Science Agent,在NatureBench评测中排名第一,超多数通用编程智体。该智体可独立完成模型研发,效率大幅提升,还探讨了其力边界、应用及对行业的影响。

DeepTech深科技
算法论文8

规范对齐时代:GPT-5 断层领先,让安全与行为边界更明晰

上海交通大学等团队提出规范对齐概念,构建评测基准 SpecBench 评测 33 个主流模型,发现多数模型有不足。还探索测试时深思方法,如 Align3 提升规范遵循度,GPT - 5 在规范对齐上断层领先。

机器之心
产品应用7

一块画板,Nano Banana,无限创意:谷歌新工具实测

谷歌Labs推出AI概念板Mixboard,由Nano Banana图像模型驱动,整合Gemini 2.5 Flash模型。可上传个人图像混合编辑,适合设计师等。现仅在美国公开测试,速度快,操作便捷,高效验证想法。

AI进修生
推荐文章8

有手就行,教你从0到1快速手搓搭建个GUI Agent

随着通用大模型发展,搭建GUI Agent难度降低。文章介绍如何用通用大模型API,从0到1搭建PC GUI Agent,包括原理、代码实现等,该Agent跨应用操作,未来可强化功

腾讯技术工程
开源动态8

湾大北交大开源 CutClaw,自动踩点音乐的 AI 智视频剪辑师!

大湾区大学GVC实验室和北京交通大学团队开源CutClaw,它是模拟专业后期流程的多智体系统,实现音乐驱动剪辑,按文字指令自动剪辑,适配多平台,还可解构素材。操作简单,支持多模型

开源星探
开源动态8

彻底戳穿AI「失忆症」!超越OpenAI全局记忆,中国队开源LLM记忆操作系统

大语言模型有「记忆」缺失问题,国内顶尖团队打造出操作系统级AI记忆框架MemOS并开源且可商用。它将「记忆」升为「一级资源」,用MemCube封装记忆,评测显示性优于OpenAI全局记忆方案。

新智元