「动效生成」共找到 2323 篇相关文章
不看后悔!GitHub 开源 MultiTalk .8k star 强大的人语音+图像绑定项目
MultiTalk 是 MeiGen‑AI 开发的开源框架,可从音频、图片和提示语生成多人对话视频。它解决传统视频制作痛点,功能亮点多,技术优势明显,应用场景广,与同类项目对比表现突出。
CVPR 2025 | 解决XR算力瓶颈,FovealSeg框架实现毫秒级IOI分割
来自纽约大学和Meta Reality Labs的联合研究提出Foveated Instance Segmentation新方法。FovealSeg框架结合眼动追踪,能解决XR算力瓶颈,实现毫秒级IOI分割,在多数据集测试中速度与精度双赢。
AI“氛围编程”威胁开源,维护者面临危机
开源维护者正加速关闭外部贡献,因AI生成贡献量大质低。研究显示“氛围编程”会造成负反馈循环,降低软件可用性和质量。平台激励加剧问题,虽有应对策略但效果不佳。
谷歌nano banana正式上线:单图成本不到3毛钱,比OpenAI便宜95%
昨晚谷歌图像生成与编辑模型nano banana上线,正式名gemini - 2.5 - flash - image - preview。它有强大能力,成本低,有多种玩法,上线后测试火爆,在多个榜单成绩优异。
啊?豆包居然也开始卷AI编程了?
作者体验发现豆包更新了“应用创造1.0”标识的AI编程功能。该功能不仅能生成代码,还能可视化修改网页结果,用户操作轻松,降低了AI编程门槛,体验远超其他同类产品。
宇树机器人租不出去了
2025开年,宇树机器人因春晚表演成“顶流”,人形机器人租赁爆发。但热潮渐退,其租赁市场萎缩,复购率低。技术上实现简单动作难,商业化前景存疑,行业凸显理想与商业的矛盾。
何恺明首个语言模型:105M参数,不走GPT自回归老路
何恺明团队推出全新连续扩散语言模型ELF,不走GPT自回归老路。它将生成过程留在连续embedding空间,最后离散化变回token。ELF用较少参数、训练token和采样步数,跑赢主流扩散语言模型。
英伟达再破世界纪录,每秒1000 token!刚刚,全球最快Llama 4诞生
英伟达用Blackwell创下AI推理新纪录,单节点8颗GPU实现Llama 4 Maverick模型每秒单用户生成1000个token。这得益于技术组合拳,如用TensorRT - LLM优化、应用FP8格式等,满足了低延迟需求。
99%的人都不知道:MCP 必须在 Claude Code 外面装
作者分享飞书MCP安装经验,指出MCP要在Claude Code外安装,介绍用Cursor生成安装命令、验证安装、删除服务等技巧,还整理《MCP安装指令文档》,复制粘贴就能用。
大模型年中报告:Anthropic 市场份额超 OpenAI,开源模型企业采用率下降
本文基于年中报告指出,当前模型API支出翻倍,企业重心转向模型推理。Anthropic市场份额超OpenAI,开源模型企业采用率下降。代码生成成热门场景,企业换模型重性能,AI支出从训练转推理。