「视频 - 音频联合生成」共找到 2045 篇相关文章
OpenAI突然发布Sora 2:好一个“AI版抖音”!
OpenAI重磅上新,带来依托Sora 2的“AI版抖音”——Sora iOS APP。Sora 2是音视频同步生成模型,更遵循物理定律、可控性强,还能注入现实元素。实测效果佳但画质低,Pro版可改善,后续还会发布API。
iPhone 17 Pro居然能跑8B大模型!
iPhone 17 Pro竟能跑8B大模型,如Qwen3 - 8B,推理较流畅。作者换机一是因eSIM,二为拍视频。其认为AI普及需端侧落地,此机芯片性能是好信号,盼出优质iOS客户端。
开源AI引爆热潮!GOSIM AI Paris 2025首日直击:80+位技术大咖聊模型、拼算力、秀落地
5月6日,GOSIM AI Paris 2025大会在法国巴黎启幕,80余位技术专家与学者参会。GOSIM联合创始人认为开源AI已追上闭源,AGI或由多模型组成网络。大会设四大分论坛解析开源AI,还有特色单元,明日将迎PyTorch Day。
谢赛宁也玩MC?开源全新世界模型生成多人一致的游戏视角
电子游戏推动AI发展,谢赛宁团队探索世界模型新方向,推出多人视频世界模型Solaris。该模型能生成多人一致的第一视角,团队还搭建了多人数据采集系统SolarisEngine,构建了多人Minecraft数据集。实验结果显示,其方法在多方面表现更优。
统治AI十年的Transformer,要被亲爹亲手砸碎?
5月5日旧金山的辩论赛上,Transformer联合发明人Łukasz Kaiser为其作品辩护,三位挑战者指出Transformer五大死穴。Kaiser称除非新架构证明有更好的scaling曲线,否则Transformer仍是主流,还给出具体辩护。
嚯,具身智能和脑机接口在康复医疗合体了
在第二届傅利叶具身智能生态峰会上,CEO顾捷宣布给康复患者戴脑机接口设备,让机器人依脑电信号辅助康复训练。还启动“脑机具身·数据引擎联合创新计划”,圆桌环节嘉宾探讨技术影响与应用。
AgentCPM-Explore开源,4B 参数突破端侧智能体模型性能壁垒
清华大学等联合研发的 AgentCPM-Explore 智能体模型,基于 4B 参数在深度探索类任务表现出色,有打破参数壁垒等亮点,还全流程开源,解决小模型性能提升挑战,邀伙伴共建端侧智能体生态。
华为中科大联创大模型低比特量化算法,1‰数据实现昇腾无损压缩7倍
华为诺亚方舟实验室联合中科大提出CBQ后训练量化方案,仅用0.1%训练数据实现大模型7倍压缩,保留99%精度。该成果登ICLR 2025 Spotlight,已加入昇腾ModelSlim工具包。
全网挤爆Seedance 2.5,但2.0 fast降到6毛是真的香!
近期AI视频赛道竞争激烈,FLUX 3登场,国内巨头也纷纷推出新模型。字节Seedance 2.5优势明显,但适用特定场景。Seedance 2.0 fast降至6毛每秒,经多场景实测,表现均衡,是性价比之选。
重新审视SFT的泛化能力:优化动态、数据与模型能力的条件性分析
上海人工智能实验室等联合研究质疑了‘SFT倾向于记忆,RL实现泛化’观点,指出SFT泛化是条件性现象,受优化动态、训练数据、基模型能力影响,还揭示长思维链SFT会带来安全性能退化。