「可灵3.0」共找到 6015 篇相关文章
ACMMM 2025 | 北大团队提出 InteractMove:3D场景中人与可移动物体交互动作生成新框架
北大团队在ACMMM 2025发布InteractMove,首次提出含可移动物体3D场景中基于文本的人 - 物交互生成任务,构建数据集与创新框架,在多指标领先,代码与模型已开源。
GRPO训练不再「自嗨」!快手可灵 x 中山大学推出「GRPO卫兵」,显著缓解视觉生成过优化
GRPO在视觉生成流模型后训练阶段有显著提升,但clip机制存在系统性偏差,易使模型陷入过度优化。中山大学、快手可灵等团队提出GRPO - Guard,能降低过度优化风险,在多种任务中表现良好。
SpAItial发布超逼真3D空间基础模型
德国AI初创平台SpAItial获1300万美元种子轮融资,发布超逼真3D基础模型。其核心技术能理解3D世界,可基于文本或图片生成3D场景,在多领域有革新可能,虽有竞争,但未来有望推动AI三维突破。
从「会表演」到「更会演」:KlingAvatar2.0让数字人拥有生动灵魂
近日快手可灵团队发布 KlingAvatar2.0 技术报告,数字人能‘生动表达’。它有三大创新技术,如时空级联框架等。实验显示其生动性大幅提升,性能超竞品,推动数字人在多领域规模化应用。
仅保留35% Token,性能反超原模型!快手可灵等用视觉信息引导音频压缩,推理时间直降42%
Omni - LLM计算浪费严重,快手可灵等团队提出OmniSIFT框架。它利用音视频非对称依赖关系,通过时空联合剪枝压缩视频、视觉引导筛选音频Token,大幅减少Token数量,提升性能和推理效率。
自写驱动越狱!Gemini 3 Pro零败绩通关宝可梦:效率碾压前代8倍「Agent进化太快了」
在全自动《宝可梦 水晶版》对决中,Gemini 3 Pro击败Gemini 2.5 Pro,通关速度至少快2倍,前代或慢8倍。它还展现出诸多能力,如自写驱动绕过限制等,但也存在不验证假设等局限。
0.3B参数,600MB内存!腾讯混元实现产业级2Bit量化,端侧模型小如手机App
腾讯混元团队推出面向消费级硬件的“极小”模型HY-1.8B-2Bit,参数量仅0.3B,内存占用600MB。它基于产业级2Bit端侧量化方案,生成速度提升,还通过多种方法提升能力,未来将探索新技术缩小与全精度模型差距。
阿里HappyHorse开启灰测,720P视频生成低至0.44元/秒
4月27日,阿里巴巴视频生成模型HappyHorse 1.0开启灰测,全球专业创作者和企业级客户可在官网和阿里云百炼平台注册使用,大众用户可在千问App体验。官网720P视频生成刊例价0.9元/秒,专业会员包月叠加限时折扣后低至0.44元/秒。
Karpathy的软件3.0:Agent的原生世界
OpenAI联合创始人Andrej Karpathy在Sequoia Ascent大会上表示,AI Agent正改变软件与工作模式。编程基本单位从写代码变为给Agent下达指令,软件3.0以上下文窗口为程序,LLM为解释器。他还提出理解AI能力分布的框架,给出创业建议。
CVPR 2026|清华联合美团推出3DThinker,首个用3D意象思考的工作
当前多模态大模型在空间理解任务表现弱,缺乏对几何信息提取能力。清华联合美团推出3DThinker,无需3D标注和外部工具,让模型内蕴‘想象’三维场景,在多基准上提升效果,且具备一定可解释性。