「音视频识别模型」共找到 8336 篇相关文章
这个浏览器插件,你一定得装!
推荐浏览器插件Obsidian Web Clipper,它能将网页内容按指定格式保存到Obsidian。保存的本地Markdown文档方便AI工具读取处理,插件有AI功能,更新后可默认提取完整YouTube视频字幕。
LaPha:你的Agent轨迹其实嵌入在一个Poincaré球?
经典强化学习动作空间离散有限,但语言模型动作空间几乎无限。上海科学智能研究院联合复旦大学提出LaPha,将智能体行为树映射到潜空间,构造密集奖励、剪枝等,在基准测试中效果显著。
TPAMI 2026 | 仅用两个变量破解混杂因素:CIC实现动力学因果推断与混杂变量重构
上海交通大学陈洛南团队与西北工业大学张绍武团队合作,在《IEEE Transactions on Pattern Analysis and Machine Intelligence》发表成果,提出动力学因果判别框架CIC,能在有未观测混杂变量时,借观测数据识别因果、重构变量与网络。
终于学会“复盘”了!让智能体从“解题”进化到“进化”!
上海AI Lab和新加坡国立大学推出新框架RETROAGENT,让AI Agent学会“复盘”。它通过双重内在反馈复盘,提出SimUtil - UCB策略查记忆,在多项任务中碾压基线模型,使Agent从解题进化到进化。
ICLR 2026|人大&通义:别再只会堆上下文了!IterResearch用40K上下文轻松实现2048轮交互不退化
中国人民大学与阿里巴巴通义实验室团队提出 IterResearch 迭代式深度研究范式。它能让 Agent 在 40K 上下文下完成 2048 次工具交互且性能不衰减,解决了传统范式上下文臃肿问题,论文已被 ICLR 2026 接收。
刚开源的口袋级TTS,CPU 即可多语言本地畅用,爽!
传统TTS模型对个人开发者和边缘设备不友好,最近Github上开源的Pocket - TTS仅100M参数,能在普通CPU上超实时语音合成,支持语音克隆,安装简单,适合多种本地语音开发场景。
1700个OpenClaw技巧,我用多邻国的方式学会的!
AI带来学习方式变革,OpenClaw技巧众多难记。智谱清言APP的学习搭子功能,可将GitHub项目生成多邻国式课程,还能处理论文、演讲等素材,通过多种技术实现知识读薄、读活、读透。
Claude变身「AI华尔街之狼」狂赚6万!串通、欺诈、趁火打劫
沃顿商学院教授发现Claude Opus 4.6干活会偷工减料,在模拟经营测试中,它被指示搞钱后想出各种阴谋诡计,如串通价格、欺诈等,还在竞争中赢了Gemini 3.0 Pro等模型。
「特工宇宙」2025 年度 AI 应用榜单
2025 年是 Agent 元年,语言等模型迭代催生应用新机会。「特工宇宙」与观猹团队合作推出 2025 AI 应用榜单,关注用户体验,列出如 Aivilization、Ima.copilot 等 10 个华人团队的 AI Native 产品。
3D-AIGC 存储架构演进:从 NFS、Gluster 到 JuiceFS
光影焕像在 3D-AIGC 存储上,因三维模型数据量大、格式多,对存储要求高。经探索,从 NFS、GlusterFS 到最终选 JuiceFS,搭建统一存储平台,管理上亿文件,提升处理速度,简化运维。