「开源视觉模型」共找到 9083 篇相关文章
今天,好像见证了属于SD时代的消亡。
liblib宣布升级到2.0,作为国内最大SD生态开源社区,其转型宣告SD时代落幕。曾几何时,SD让普通人感受AI绘图魔力,如今技术迭代,AI绘图门槛降低,新模型受大众青睐。
中国AI「星际穿越」!新智元十周年峰会预言ASI终局:未来十年指数级加速
新智元十周年峰会以「新天终启 万象智生」为主题,众多大咖齐聚。王海峰、赖俊杰、王小川等分享观点,还开源模型、发布奖项。大家认为AI发展虽有波折,但2027年将达ASI临界点,智能体大爆发。
北大卢宗青团队新作:超 70% 实机成功率,支持语言指令的功能性抓取系统
现有抓取研究多在稳定性层面,而功能性抓取更接近真实世界的智能。北大卢宗青团队提出DemoFunGrasp方法,对功能性抓取重新建模,在仿真与真实场景均超70%成功率,还引入视觉语言模型让机器人理解语言指令。
OpenAI偷袭,谷歌掀桌!2026开年第一场AI大战太精彩
OpenAI悄悄上线ChatGPT Translate挑战谷歌翻译,该工具支持超50种语言,有翻译后「二次加工」能力,但功能尚不完善。谷歌则高调开源TranslateGemma模型,支持55种语言,效率惊人,12B参数超越27B基线。
Meta Shuffling的MoE Grouped GEMM kernel benchmark
作者拷贝fbgemm开源的moe grouped gemm kernel,修复小bug后与SGLang的Grouped GEMM Triton Kernel对比,结果显示fbgemm在MoE模型上性能提升显著,可应用到SGLang的ep - moe的grouped gemm kernel中。
告别「面瘫」配音,InfiniteTalk开启从口型同步到全身表达新范式
传统video dubbing技术有局限,新兴模型也有问题。美团视觉智能部研发的InfiniteTalk引入‘稀疏帧video dubbing’,实现口型、表情、肢体与音频自然对齐,解决长视频生成难题,技术已开源。
“同事.skill”不用写了,爱马仕 Hermes 主动“蒸馏”你,还让开发者集体抛弃 “龙虾”?!
近日,Hermes Agent 在国内爆火,获超 3.9 万 stars。它是单 Agent 架构,核心是学习循环,记忆分层管理。其网关功能强大,状态可跨会话留存。背后的 Nous Research 目标是打造抗衡 OpenAI 的开源模型,还引入区块链解决算力问题。
一张图片+ 一条音频,照片开口说话唱歌,多角色、情绪控制都拿捏了。
腾讯混元联合腾讯音乐推出 HunyuanVideo - Avatar 模型,上传照片配音频就能生成动态视频。支持多风格角色、情绪控制和多角色对话,单角色模式已开源,技术有创新,在多数据集表现优。
我们对 Coding Agent 的评测,可能搞错了方向
用户对 Agent 不满常因它「做得不好」,不遵循指令和规范。当前主流评测体系以结果为导向,与真实场景错位。MiniMax 开源 OctoCodingBench 评测集,结果显示模型过程规范遵循不足,未来训练需引入过程监督。
3000块钱,这支中国团队把ChatGPT成功的“秘密”用在了机器人训练上
国内穹明智能团队推出千元级手持采集系统 UMI ver.2 并开源。该系统精度达毫米级、能双臂协同,成本低、部署快。团队认为数据是关键,还计划搭建机器人数据 infra,预计新模型范式很快出现。