「开源模型」共找到 8996 篇相关文章
面向UE5的智能数字人系统
GMTalker是光明实验室媒体智能团队为虚幻引擎5.3打造的智能数字人系统,集成多种能力,适用于科研等场景。具备多功能特点,与其他开源方案对比优势明显,还介绍了环境要求、启动方式、配置、API等。
百度用50天将视频价格打到行业70%!内部负责人:成本优化还有空间
8月21日百度蒸汽机音视频一体化模型重大升级,实现多人有声视频一体化生成。有五大核心技术突破,价格低至行业70%。源于算力和工程优化积累,未来还会优化成本,其盈利不依赖调用次数,带动平台生态升级。
告别「面瘫」配音,InfiniteTalk开启从口型同步到全身表达新范式
传统video dubbing技术有局限,新兴模型也有问题。美团视觉智能部研发的InfiniteTalk引入‘稀疏帧video dubbing’,实现口型、表情、肢体与音频自然对齐,解决长视频生成难题,技术已开源。
视频「缺陷」变安全优势:蚂蚁数科新突破,主动式视频验证系统RollingEvidence
蚂蚁数科AIoT团队论文提出主动式可信视频取证系统RollingEvidence,利用相机卷帘门效应嵌入物理水印,结合AI与概率模型验证,抵御伪造篡改,在检测准确率和防护能力上优于传统技术。
Meta超级智能实验室重组为四个部门,某些高管将离开
据《彭博社》报道,Meta 将重组超级智能实验室及相关 AI 部门为四个新部门,某些高管预计离职。Meta 此前大力挖角,此次或从依赖内部开发转向集成第三方模型,扎克伯格强调对超级智能的推动。
图生视频新玩法刷爆外网:图上画两笔就能动起来,终于告别文本提示
Higgsfield AI 是专注 AI 视频生成的初创公司,近期发布 Draw-to-Video 和 Product-to-Video 功能,前者画图形元素就能生成视频,后者可拖拽生成广告视频。它还常上新功能、集成热门模型,官网功能模板丰富。
老黄力推的 Physical AI,有人用开源框架打通了硬件的最后一道关
巨头加速布局Physical AI,全球AI云平台涂鸦智能用TuyaOpen开源框架破局,为开发者提供入场券。它可拆技术墙、通生态孤岛、跨商业化黑洞,还让开发者打造多样AI硬件,助力商业化。
0 融资、10 亿美元营收,数据标注领域真正的巨头,不认为合成数据是未来
Surge AI创始人Edwin Chen接受访谈,提出创业应解决问题而非融资,合成数据被高估,高质量数据才是壁垒。他还指出大语言模型竞技场误导训练方向,人类反馈永不过时,数据质量是AI发展首要瓶颈。
BLIP3-o统一图像生成与理解,多模态融合趋势显现
BLIP3 - o致力于统一图像理解和生成,提升生成质量与效率。它融合自回归和扩散模型,采用CLIP + Flow Matching架构等。经训练,在图像理解和生成任务表现佳,指令微调效果显著。
当人们误解了AI的本质,会发生什么?
文章指出尽管科技公司CEO宣称AI强大,但大语言模型无人类智慧。人们误解AI本质危害多,如将其当精神导师、用AI替代人际互动等,还揭露产业背后廉价劳工,强调要认清AI本质。