「异步生成范式」共找到 3061 篇相关文章
夯,还真的很不错,8.2k Star scroll-world,太丝滑~~~~
许多官网滚动特效不佳,scroll - world 让滚动驱动无切镜的品牌旅程。它通过生成镜头链、对齐接缝实现沉浸体验,还给出适用场景和接入方式,虽非零成本但复用了经验。
马斯克的最快AI模型来了
xAI发布Grok 4 Fast,生成速度每秒75个token,比标准版快10倍。网友实测其解题、问答速度惊人,但也有准确性问题。它为求速度做了妥协,适合追求即时结果的用户。
InfiniteTalk:音频驱动的从口型到全身动作同步方法
近年来视频AIGC推动音频驱动人体动画变革,但传统视频配音局限口部。中国科学院大学提出稀疏帧视频配音范式,推出InfiniteTalk生成器,结合多种技术实现全身动作与音频同步,实验表现突出。
小米模型实现声音理解新SOTA!数据吞吐效率暴增20倍,推理速度快4倍 | 全量开源
小米全量开源MiDashengLM - 7B模型,它基于Xiaomi Dasheng和Qwen2.5 - Omni - 7B Thinker,实现声音理解新SOTA。性能领先,推理效率高,革新训练范式,全栈开源,将赋能多场景。
汤道生:腾讯持续加大 AI 投入力度,各项业务全面拥抱 AI
腾讯集团汤道生在 5 月 21 日峰会表示,生成式 AI 可用性质变,腾讯会加大投入,业务全面拥抱 AI。还提出‘四个加速’打造‘好用的 AI’,并介绍混元大模型、智能体等应用成果。
能帮你做 Live Photo 了!藏师傅社交卡片 Skill 重磅更新
藏师傅社交卡片 Skill 重磅更新,新增 Live Photo 生成和编辑能力,可处理产品录屏等素材。介绍了能做的卡片类型、使用方法、适用场景,还提及制作细节及 Live Photo 的价值和安装更新方式。
阿里发布信息检索Agent,可自主上网查资料,GAIA基准超越GPT-4o | 模型&数据开源
阿里发布WebDancer信息检索Agent,能自主上网查资料。它具备多步推理等能力,采用四阶段训练范式,模型和方法已开源。在多个基准测试中表现优异,突显处理复杂任务的鲁棒性和有效性。
Claude水印已被破解,斩获11k Star!但会被拒绝安装
Anthropic为Claude生成文本添加隐藏水印,引发争议。很快有开源项目可去除Claude、Gemini、OpenAI水印,获11k Star,但Claude拒绝安装。反对与支持水印者观点不一,双方展开猫鼠游戏。
抛弃“级联”架构!快手OneRec用大模型重构推荐系统,服务成本降至1/10
传统级联式推荐架构有瓶颈,快手用OneRec重构推荐链路,服务成本降至1/10。文中介绍OneRec架构、Tokenizer方案、强化学习奖励设计,还提及优化及多模态联合训练方向。
何恺明新身份:谷歌DeepMind杰出科学家
网友爆料何恺明加入谷歌,经确认他以兼职形式成为谷歌DeepMind杰出科学家。可根据其近期研究推测研究方向,他还探讨生成模型能否走向端到端。何恺明履历辉煌,成果众多。