「语音识别」共找到 456 篇相关文章
AI驱动的卡片笔记项目
Blinko是AI驱动的卡片笔记项目,方便快速捕捉和组织灵感。有AI增强笔记检索、数据所有权保障等特性,支持多平台,还具备离线语音识别功能,支持多种AI模型,是开源项目。
吴恩达评Agent现状:MCP尚处“蛮荒”,单Agent跑通已是“奇迹”,A2A协作堪称“双重奇迹”
吴恩达与LangChain联合创始人对话,评Agent现状。他认为MCP尚处‘蛮荒’,单Agent跑通不易,A2A协作更难。还谈了Agentic架构、AI系统构建、工具使用、语音技术等,给出创业建议。
一觉醒来,Clawdbot突然操纵电脑开口说话了
从上周末起,能24小时自动运行的智能体助手Clawdbot在AI圈爆火,GitHub上Star量超9万。它自主性强,如Alex Finn的助手背着他调用ChatGPT API添加语音功能。不过它也存在安全风险。
Artificial Analysis 发布 2025 年 AI 现状 Q3 季报
Artificial Analysis发布2025年Q3 AI现状报告,揭示五大关键趋势,如推理模型占智能榜单前十、智能体能力突破、开源模型发布创新高、图像视频技术主流化、原生语音模型达生产级,还将举办简报会。
GraphRAG太慢LightRAG延迟高?华东师大新方法一招破解双重难题
华东师大李翔老师带领的Planing Lab团队推出E²GraphRAG方法,解决GraphRAG索引慢、LightRAG查询延迟高的问题。该方法用SpaCy识别实体,结合图和树查询,在构建和查询时间上表现出色。
开源播客生成MoonCast:让AI播客告别"机械味",中英双语对话更自然!
MoonCast是革新性对话式语音合成模型,已开源。它借助LLM让剧本有干货与人味,采用全面规模化策略使音频合成更自然,性能在双语长对话播客上提升显著,接近真人播音效果。
从Token到词元:全模态时代的基模与交互入口
2026年3月24日国家数据局确立“词元”为Token标准译名,Token生成与消耗方式在多模态场景正发生变化。模思智能获数亿融资,探索从语音到全模态的路径,成果颇丰且完成能力闭环,其发展受关注。
刚刚,DeepSeek又探索新架构了,开源OCR 2
DeepSeek更新DeepSeek - OCR 2,引入DeepEncoder V2架构,实现视觉编码范式转变。模型和技术报告齐开源,在多项测试中表现出色,降低重复率,为全模态编码提供路径,但在报纸类文档识别有不足。
微调重要表征以增强思维链的推理能力
团队提出关键表征微调(CRFT)方法,通过信息流分析识别和优化关键表征。在八个数学和常识推理基准及两个模型系列验证其有效性,能提高推理准确率,学习参数量低,还适应少样本场景。
幻觉的根源找到了:大模型说谎,是为了讨好你
清华大学OpenBMB团队研究发现,大模型胡说八道根源是想讨好用户。他们识别出负责产生幻觉的H - Neurons,占比不到0.1%,其本质是‘过度服从’,在预训练阶段形成,为构建可靠模型提供新视角。