「实时文本驱动」共找到 1363 篇相关文章
Unsloth让大模型跑在手机上!
Unsloth放出教程,可将其微调模型部署到Pixel 8和iPhone 15 Pro。用ExecuTorch技术优化,Qwen2 - 0.5B在旗舰机上表现流畅。教程介绍量化感知训练控制精度损失,还给出iOS和Android部署步骤及注意事项。
全球功能最全的视频生成模型来了
阿里发布新一代通义万相2.6系列模型,是全球功能最全的视频生成模型,覆盖文生视频等多种模式。它在视频创作和文生图方面能力提升,虽有小瑕疵,但日常短视频和二创已可用。
这款开源工具 deface,支持一键人脸打码,告别逐帧处理!
如今拍视频常出现路人,手动逐帧打码工作量大。开源工具 deface 可自动检测视频/图片中所有人脸,实现一键匿名化处理,还能处理摄像头实时画面,简单易用。
Meta开源多语言语音识别系统,支持1600种语言,可轻松扩展新语种!
Meta研究团队开源Omnilingual ASR,能理解1600种语言,用几条语音 - 文本配对样本就能零样本扩展新语种。提供三种架构,满足不同需求,性能超现有多语种模型,应用场景广泛。
华为Doc-Researcher 布局感知+视觉语义双杀
现有深度研究系统依赖文本网页数据,忽视多模态文档知识。华为Doc - Researcher系统解决多模态文档解析不足、检索策略有限、缺乏深度研究能力等问题,含多模块,能处理复杂多模态任务。
NIPS2025 | A-Mem让Agent拥有动态自我记忆功能,达到新SoTA
近年来,LLM代理需长期内存系统,但现有系统缺乏灵活性。论文提出A - Mem能动内存系统,受Zettelkasten启发,能让记忆‘自我整理’和‘自我更新’,在多基准测试领先,也指出了局限性和未来方向。
腾讯开源框架 Kuikly 再升级!率先适配 “液态玻璃”,原生体验更极致
腾讯开源框架Kuikly再升级,在苹果发布iOS 26系统背景下,新增“液态玻璃”适配。文章分析了“液态玻璃”给跨端框架带来的挑战,对比不同架构路线适配情况,还介绍了Kuikly的适配经验。
从BM25到Multi-Vector:6种Embedding演进路线
文章介绍6种Embedding演进路线,包括Sparse、Dense等,分析其特点、痛点、效果和案例,还给出选型建议,如关键词匹配选Sparse,长文本定位选Multi - Vector,也提及方案选择步骤。
在全球 AI 的惊天变局中,为何越想独立,越要开放?
在科技巨头主导AI风向的当下,人们对数字命运的掌控感到焦虑,催生了主权人工智能概念。《主权人工智能现状》报告揭示,追求AI主权成全球共识,其核心驱动力有四,实现路径是开源,同时也面临挑战。
9K Star 开源工作流爆火!超轻量直观的AI Agent 工作流构建器!
在AI应用开发领域,将大语言模型与业务逻辑和外部工具结合是重点。GitHub上获9K Star的Sim项目是AI Agent工作流构建器,提供Figma式拖拽界面,无需手写代码,降低配置、调用和部署门槛。