「说话人识别」共找到 1347 篇相关文章
0.07B大败QwenVL72B!百度开源OCR3.0"三件套"
OCR 历经四次范式迁移,工业落地存在精度与参数量等矛盾。百度开源 PaddleOCR 3.0“三件套”,含 PP - OCRv5、PP - StructureV3、PP - ChatOCRv4,各有创新点,解决了多语种识别、版面还原等问题。
智谱AI发布桌面Agent,轻松训练 AI数字员工
智谱AI发布ComputerRL自主桌面智能框架,旨在让AI像人一样用电脑。它融合API与GUI,采用分布式训练,引入Entropulse解决探索衰减。在OSWorld测试中表现亮眼,虽有视觉感知等挑战,但意义重大。
从传统编程转向大模型编程
文章指出大模型编程时代,开发者要从‘代码产出者’变为‘文档定义者’,介绍其优势、人+AI结对编程模式,还提及模型工具技巧、开发流程、常见陷阱及应对策略,强调文档驱动和安全合规。
Wispr Flow 平替, 这款开源中文语音助手,程序员真该试试,本地离线的中文语音输入神器来了(开源白嫖版)
蛐蛐(QuQu)是开源桌面应用,用本地语音识别模型和配置的大语言模型,将语音实时转文字并润色。它主打本地语音工作流,替代Wispr Flow,免月费且保护隐私,适合中文用户。
9B 模型“平替”GPT-4o ?!面壁赌对OpenClaw端侧AI,内部上演一人月产65万行代码的效率核爆
2023年面壁智能转攻端侧大模型,起初遭质疑,后获市场认可。今年发布开源全模态模型MiniCPM - o 4.5,年中还将推AI硬件松果派。其内部有“一人公司”趋势,对未来端侧智能发展有清晰判断。
不装了!LeCun哈萨比斯神仙吵架,马斯克也站队了
图灵奖得主Yann LeCun与诺贝尔奖得主、谷歌DeepMind CEO哈萨比斯就“智能的本质”展开激辩,马斯克站队哈萨比斯。二人观点分歧大,后LeCun称主要是用词分歧,双方都关注世界模型,但理解和实践有别。
小红书团队开源dots.ocr:文档解析新王者,性能比肩Gemini!
文档解析领域处理多语言复杂文档需高效能力,传统OCR工具存在不足。小红书HiLab开源多语言文档解析模型dots.ocr,基于1.7B参数视觉语言模型,性能达SOTA,单页PDF处理快,公式识别媲美大模型。
融资千万的 Violoop ,要做中国版的「硬件龙虾」
AI科技公司Violoop创始人何佳霖,想做中国版“硬件龙虾”,让AI 24小时为人类打工。其产品是手掌大小桌面硬件,3月12日完成数千万元融资,将用于产品落地等。团队最初尝试纯软件路线,后因安全等问题转向硬件。
打穿 AI 智商测试!GPT-6 Astra 的符号世界模型,是突破还是钞能力刷分?
OpenAI的GPT-6 Astra亮相,在ARC - AGI - 3测试成绩逼近100%,远超GPT - 5.6 Sol。它生成的符号世界模型被认为是AI迈向高级推理必经之路。不过出题人指出其靠Harness加持,离AGI还远。
何恺明CVPR最新讲座PPT上线:走向端到端生成建模
今年CVPR闭幕,何恺明现身会场并做了主题为‘走向端到端生成建模’的分享,近日其个人网页上传了该分享PPT。PPT回顾识别模型演进,探讨生成模型能否重演历史,还介绍了MeanFlow方法及成果。