自动语音识别」共找到 1003 篇相关文章

开源动态8

没想到,32B清华DeepDive掀翻深度搜索全场的!

文章指出大模型在真实深网搜索场景表现不佳,核心矛盾是缺‘难搜’数据和多轮工具调用 RL。清华 DeepDive 用数据合成造‘难搜’题,端到端多轮 RL 训练,在 BrowseComp 刷新开源记录,迁移能力也强。

PaperAgent
开源动态8

阿里重磅开源:端到端VLM文档解析模型,图片直出结构化HTML!

在AI文字识别类应用中,文档解析常不尽人意。阿里开源端到端文档解析模型Logics - Parsing,基于VLM,能图片直出结构化HTML,有统一、智能、精细等亮点,还给出使用步骤。

开源星探
算法论文8

比思维链准43%!逻辑脑+大模型直觉,推理可靠性大幅提升

中德研究团队发布成果,给大模型外挂「逻辑脑」,结合答案集编程与LLM,构建神经 - 符号框架,提升空间推理准确率,让AI能说清逻辑、跨任务迁移,迈向更可靠的通用推理。

新智元
推荐文章7

我这半年看过最好的 Vibe Coding 技巧

OpenAI 创始成员 Andrej Karpathy 在 X 阐述 Vibe Coding 实践,提出建立三层结构让不同工具各司其职完成开发。介绍不同场景适用工具,还谈及‘后代码稀缺时代’焦虑,给开发者带来启发。

MacTalk
推荐文章8

使用 Claude Code 自动化 GitHub Actions

这篇技术博客介绍用Claude Code自动化GitHub Actions Runner镜像更新工作,包括用其处理补丁冲突、分析变更,以减少人工工作量,提升开发者生产力,还给出实现细节与代码。

AGI Hunt
开源动态8

“AI大神”李沐终于开源新模型,爆肝6个月,上线迅速斩获3.6k stars!

7月23日,“AI大神”李沐开源音频基础模型Higgs Audio v2,构建于Llama - 3.2 - 3B之上,预训练数据丰富。该模型在多个测评中成绩领先,有多种能力,李沐介绍其技术及训练方法。

AI前线
产品应用8

AI 集成的智能 Profiling 实践:从性能分析到优化闭环

本文由韩钦亭撰写,分享了在已有 Profiling 平台引入 AI 智能辅助模块的实践。介绍了设计思路、工程实现、应用成效,对比不同大语言模型,通过实际案例展示优化效果,还探讨了 AI 在性能优化场景的未来潜力。

InfoQ
产品应用7

不要再拖拉拽了,利用n8n mcp直接生成n8n工作流

n8n是国外热门的AI应用编排工具,但用好它生成工作流并不容易。现介绍能生成n8n工作流的mcp,简单配置即可让AI生成工作流,其地址为https://github.com/czlonkowski/n8n - mcp。

AI工程化
产品应用8

Cursor这波1.0升级,真的要把程序员饭碗摔碎了~

今天Cursor 1.0硬核发布,跨越多个版本。它集成主流MCP、Memory、Agent技术,有BugBot自动代码审查等功能,支持Jupyter Notebook集成,聊天界面体验也更丰富,大幅提升开发生产力。

PaperAgent
算法论文8

CVPR 25 |全面提升视觉感知鲁棒性,生成模型快速赋能三维检测

香港中文大学(深圳)等单位学者提出 DriveGEN 无训练自动驾驶图像可控生成方法,无需额外训练生成模型,通过两阶段策略扩展训练数据,提升三维检测模型鲁棒性,代码已开源。

机器之心