「实时长视频」共找到 1778 篇相关文章
Mamba一作预告新架构!长文论述Transformer≠最终解法
Mamba一作将演讲整合成科普长文,探讨SSMs和Transformer模型权衡之术。认为Attention非万能,Transformer是阶段性最优。几天后将发布新架构,能与Transformers兼容,还回顾了两模型特点及结合优势。
倒反天罡:ChatGPT教人说话?36万视频+77万播客已证实!
最新研究警告,ChatGPT正改变英语表达方式,植入自身偏好。研究人员分析超36万视频和77万播客,发现GPT词汇使用率显著攀升。但研究有局限,且AI沟通还引发信任危机等问题。
阿里搞了个全能解析器,文档、图片、音频、视频一锅端
阿里巴巴开源 Logics-Parsing-Omni,用一个模型统一处理文档、图片、音频、视频四种模态,输出结构化 JSON 数据。它采用三级渐进解析框架,两阶段训练策略,在自建基准上多项指标超越 Gemini - 3 - Pro。
Sora 2深夜来袭,OpenAI直接推出App,视频ChatGPT时刻到了
别家节前卷大模型时,OpenAI 悄悄发布 Sora2 并推出 App,还有配套视频推送算法防成瘾。Sora2 在物理准确性等方面优于以往系统,具备同步对话和音效能力,Altman 称是 ChatGPT for creativity 时刻。
AAAI 2026 Oral | 手机传感器正在泄露隐私?PATN实时守护隐私安全
移动应用获取手机传感器数据支撑重要功能,但带来隐私隐患。西安交通大学与东京科学大学在AAAI 2026提出PATN框架,基于对抗攻击思想,设计两大核心技术,能在多种场景下守护隐私安全。
Claude Code 学习最佳实践:NotebookLM 生成全套学习视频+卡片+测试题
文章介绍用NotebookLM学习Claude Code的最佳实践。有人将36篇Claude Code资料“喂”给它,生成含音视频的学习资料库。NotebookLM能多种形式输出,支持多类型输入,值得纳入日常工作流。
阿里开源 Wan2.2-Animate!统一角色动画和视频人物替换
阿里通义实验室开源 Wan - Animate,这是用于角色动画与替换的统一框架。它构建于 Wan 模型之上,支持角色动画和角色替换两项核心功能,性能超现有算法,还通过独特设计实现多种效果。
AI终于“长”进机器人身体里!机械臂学会用触觉思考
香港科技大学申亚京教授团队研发出具身机器人手臂 EmArm,实现亚毫米级触觉定位与实时‘感知 - 行动’闭环。研究还提出‘感知 - 驱动’一体化算法,为打造物理 AI 机器人提供可扩展技术路径。
一手实测全新的Sora 2 - AI视频的ChatGPT时刻到来了。
OpenAI发布Sora 2和Sora APP,Sora 2是视频和音频生成模型,在运动质量、人物表演、音频生成等方面表现出色;Sora APP类似AI版抖音,有社交互动“cameos”功能,但产品未来尚不明朗。
132万字实时字幕!阿里语音模型支持影视飓风100小时直播
阿里升级实时语音识别大模型Fun-ASR-Realtime,首字延迟在百毫秒级别、识别准确率接近离线模型。在影视飓风100小时直播中表现出色,还支持16种方言和30种语言,离线模型Fun-ASR-Flash全球权威榜单排第一。