「音视频实时交互模型」共找到 1736 篇相关文章
狂揽24k+ star,Web 开发效率快5倍!
传统浏览器调试工具操作繁琐、效率低,难以满足开发者需求。开源工具`Responsively App`基于Electron构建,可同时展示多设备视图,有交互同步等功能,获24k+ star,支持多系统,安装便捷。
首个用户生活「长程模拟器」来了!LifeSim 重新定义大模型个性化评测
现有个性化助手评测基准与真实用户-助手交互脱节,来自复旦大学等的研究人员提出 LifeSim 框架及 LifeSim-Eval 评测方法。实验显示主流 LLM 处理显性需求尚可,隐性意图识别等方面短板明显。
狂揽 11.8K Star!用大厂 PUA 话术「驯化」AI,这个项目把 Claude 逼成了卷王!
GitHub上名为PUA的项目狂揽11.8K Star,作者用大厂PUA话术‘驯化’AI,总结了AI的‘五大摆烂行为’,建立‘心理学框架’,实测数据显示能提升AI编程效率,还介绍了安装方式和常用命令。
OpenClaw 爆火背后 | GAIR Live 026期预告
2026年初OpenClaw爆火,上线两月成GitHub Star最高项目。GAIR Live 026期圆桌将从OpenClaw切入,探讨IoA本质,涉及热点复盘、架构之争、生产力重构、未来展望等核心议题,还有业内嘉宾参与讨论。
基础模型又一关键拼图,腾讯混元发布训练新范式「无相」:引入功能性记忆,打破静态权重枷锁
腾讯混元团队发布HY - WU范式,打破静态权重束缚,引入功能性记忆,实时生成个性化参数。应用于图形编辑基模效果好,在图像编辑任务表现优秀,还对未来AI架构提出多方面展望。
ICLR 2026|在「想象」中进化的机器人:港科大×字节跳动Seed提出WMPO,在世界模型中进行VLA强化学习
香港科技大学 PEI - Lab 与字节跳动 Seed 团队提出 WMPO 新范式,可让具身智能在‘想象中训练’,解决传统 VLA 训练瓶颈,目前论文、代码与模型均已开源。
马斯克深夜点赞!内容的下一站是:玩!
马斯克深夜点赞用 Loopit 制作的互动 meme,引发关注。Loopit 让用户体验从‘看’变‘玩’,实现双向交互。其融合 AI Coding 与多模态生成,构建 Runtime,解决延迟、状态同步等问题,潜力大。
完全取代Claude Code?OpenAI反击来了,推出Codex app「限时免费使用」
OpenAI推出macOS版Codex应用,反击Claude Code。它有全新交互界面,助开发者管理多AI Agents,支持并行任务。限时内,ChatGPT部分用户可免费使用,速率限制有调整,还具备多种新特性。
AI 驱动的智能异常处置:从异常发现到根因定位
在 2025 年 QCon 全球软件开发大会(北京站)上,阿里云算法专家张颖莹分享《AI 驱动的智能异常处置:从异常发现到根因定位》。她介绍阿里云计算平台运维挑战,给出算法选型与设计思路,还提及后续平台建设规划。
让AI像人类画家一样边画边想,港中文&美团让模型「走一步看一步」
在文生图和视频生成领域,现有模型处理复杂任务常出错。港中文和美团团队提出TwiG范式,将视觉生成拆解为“生成-思考-再生成”循环,经实验验证有效,有望拓展到更多领域。