「图像和视频换脸」共找到 7640 篇相关文章
我给剪辑产品 0 元雇了个外部研发部:它开始自进化
作者的剪辑产品有了“外部研发部”——Agent。它每天研究新方法、用真实项目测试。作者三步搭建此“研发部”,让其自动查询、测试和汇报,自己负责最终决策,项目获取新方法不再只靠偶然。
今年 AGI 大会上,这 10 个创业团队最受关注
在 AGI Playground 2026 的 Founder Show 活动上,10 个创业团队展示项目,横跨 Agent 基础设施、Physical AI 等方向。如 Tap8 实时生成交互视频,EigenFlux 为 AI Agent 建网络,Aceii One 是 AI 网球机器人等。
李飞飞押注的空间智能:生成的世界,如何「经得起折腾」?
李飞飞押注的空间智能是世界模型主流路线之一,旨在让AI生成可操作三维世界。但当前AI生成世界存在“中看不中用”问题,构建“站得住”的世界面临速度与状态瓶颈,生境科技等实践提供了解决思路。
一个「流浪」数学家的遗产,正在被AI公司疯抢
2026年,OpenAI等公司用AI解决多个匈牙利数学家Paul Erdős提出的问题,震动数学界。这些问题分布广、难度跨度大,适合模型测试。不过,AI证明的验证和人类数学家地位受关注。
马斯克4000亿布局Agent :杀死 Cursor,Bot 有什么绝招?
马斯克花600亿美金买下AI编程产品Cursor俩月后,SpaceXAI发布Grok Bot。它定位特殊、可跨应用操作等,亮点是多智能体云端协作,但产品力与生态有差距,定价高端。
Agentic RL 后训练资源怎么分?港中文、恒生大学提出 Libra,吞吐最高提升 3 倍
大语言模型走向“完成任务”,Agentic RL 后训练让系统工作负载不稳定。港中文和恒生大学团队提出 Libra 资源管理系统,统一优化训练与 rollout,在多任务中提升吞吐,论文与代码已公开。
kimi K3超大杯升级背后的技术内幕
文章介绍开源模型 K3 架构设计思路。主要探讨 MoE 和 MLA 部分,在 MoE 方面提出 SiTU、Norm、QB 改进;在注意力机制选择 MLA,与 KDA 混合缓解部分问题,还谈及 DSV4、NoPE 相关特点。
10.2k星!Firecrawl开源PDF解析神器,大幅降低OCR成本
处理PDF时,若全用OCR成本和延迟会增加,直接提取文本又易遇乱序、乱码等问题。Firecrawl开源的pdf - inspector工具能智能区分扫描版和文本版PDF,按需使用OCR,精准处理。
专访酷哇杨学:世界模型的下半场,是把一次成功变成长期服务|甲子光年
在2026世界人工智能大会上,具身智能行业关注点从机器人能动转向能否进入真实场景干活。酷哇科技宣布杨学出任首席科学家,共建通用具身智能联合实验室。杨学认为行业应从证明技术转向证明实用,解决机器人在真实场景的长期稳定运营问题。
Codex 负责人:「所有人都是 builder」是个很糟糕的主意
OpenAI Codex 团队负责人 Andrew Ambrosino 认为,AI 时代产品开发各环节发生变化,实现成本降低,品味变得更重要。他还谈到岗位角色融合但 PM 不会消失,以及 Codex 发布时机和工作模式等问题。