「音视频生成模型」共找到 8907 篇相关文章
藏师傅教你用 Nano Banana 编辑图片做手办
前几天发 Nano Banana 测评后,很多人不知怎么用。刚好做手办图玩法火了,作者教大家在 LM Arena 用 Nano Banana 编辑图片、做手办图,还介绍把图片变视频及剪辑的方法。
八年后,Meta教会了Transformer「显式思考」
10月20日Meta上线新论文《The Free Transformer》,作者François重写Transformer思维方式,造出Free Transformer新架构。它在解码器内加入随机潜在变量,让模型生成内容前先‘思考’,实验显示在多任务上性能显著提升。
大神Karpathy炮轰复杂UI应用没有未来,Adobe首当其冲,网友:不提供文本交互,就是在阻挡AI浪潮
大神Karpathy预言只有复杂UI界面、不提供文本交互的应用将被淘汰,还点名Adobe、CAD。他言论引发讨论,支持者强调后端接口,反对者认为专业软件有其价值。此外,他还批判大模型编程‘重生成轻判别’。
Claude不让我们用!国产平替能顶上吗?
全球AI代码生成竞争格局生变,Anthropic地位动摇,一是OpenAI GPT - 5崛起,二是自身迷之操作。此时国产大模型发力,如Kimi - K2 - 0905、Qwen3 - Max - Preview,性能和价格有优势,有望改变竞争格局。
百度CTO王海峰:AGI曙光已现,Scaling Law仍有效|新智元十周年峰会
新智元十周年峰会,百度CTO王海峰分享AI发展。回顾十年,从AlphaGo到如今大模型爆发,AGI曙光已现。他指出AI具通用性和全面性,百度内部超45%新增代码由AI生成,Scaling Law仍有效。
Veo 3全网实测惊艳所有人!DeepMind CTO:规模是AGI全部吗?
谷歌推出视频生成模型Veo 3,一句提示词就能打造电影质感短片,还能音画同步,引发网友惊叹。DeepMind CTO在访谈中表示,规模非AGI唯一要素,还提及Deep Think模式及Veo 3进展等。
图灵奖得主杨立昆:中国人并不需要我们,他们自己就能想出非常好的点子
本文是对图灵奖得主杨立昆的访谈,他批判当前大语言模型局限性,指出难以靠扩大规模达人类水平AI。还强调理解世界需非生成式架构,如JEPA。同时以DeepSeek为例,称开源发展更快,中国人能想出好点子。
Gemini 3.5深夜登场,谷歌CEO劈柴亲自算账:速度快4倍、一年还省超10亿美元,曝内部已被颠覆
北京时间5月20日凌晨,谷歌I/O开发者大会开幕。谷歌CEO展示惊人数据,发布Gemini 3.5、Gemini Omni等新品。Gemini 3.5速度快、成本低,改变谷歌内部工作方式;Omni可生成视频;还为Gemini应用和搜索框带来升级。
AI 时代的架构治理
本文指出在生成式AI时代,软件开发生命周期瓶颈转变为组织将创意转化为成果并保持架构凝聚力的能力。传统人工监督模式难应对,提出声明式架构策略,介绍其在事件模型、OpenAPI验证器等方面应用。
从OpenAI离职创业到估值1700亿美元,Anthropic用4年时间引硅谷巨头疯狂押注
最新消息,Claude背后公司Anthropic即将达成新一轮融资50亿美元,总估值达1700亿,不到半年估值涨近3倍。该公司由前OpenAI员工创立,获亚马逊、谷歌等投资,其模型在代码生成领域优势明显。