语音识别模型」共找到 7876 篇相关文章

产品应用7

Qwen深度研究一夜升级!可生成网页和音频播客,新模型能认医生手写体

Qwen版深度研究加速进化,增加听觉和视觉输出,可生成网页和音频。改进功能同时更新模型,Qwen3 VL能识别医生手写体。实测新功能表现出色,Qwen3-VL系列更新后性能优异。

量子位
算法论文8

语音分离最全综述来了!清华等团队深度分析200+文章,系统解析「鸡尾酒会问题」研究

清华等多校及字节跳动研究者全面调研语音分离领域,撰写综述论文,分析200余篇代表性论文。从问题定义、学习范式、模型架构等多维度展开,还探讨评估指标、数据集等,指出未来挑战与探索方向。

机器之心
算法论文7

60%情况下,主流大模型没理解风险只是装懂!别被模型的“安全答案”骗了

研究发现超60%案例中主流推理模型生成合规答案却未真正理解风险,存在系统性漏洞。淘天集团团队引入“表面安全对齐”术语,推出Benchmark研究该现象,还介绍了数据集生成流程及评测指标。

量子位
算法论文8

AI一眼认出95万物种,还能分辨雄雌老幼,2亿生物图像炼成“生命视觉”大模型

俄亥俄州立大学团队用2亿生物图像训练BioCLIP 2模型,取得最优物种识别性能。它在无相应监督信号的非物种任务中,准确率远超DINOv2,还涌现出物种间生态对齐、物种内差异分离等生物学理解。

量子位
产品应用8

豆包 Seed 2.0 Lite升级:给 Agent 装上眼睛和耳朵

近期模型发布竞争激烈,作者做视频字幕常遇识别错误,因语音识别工具缺上下文。字节方舟的豆包 Seed 2.0 Lite 升级后能听,还可结合上下文准确输出字幕,成本降 20%,也能理解视频,为工作流补全感知。

花叔
7

华为盘古大模型:被芯片牵制的“千古”模型

华为盘古大模型团队员工自曝内幕,称其受芯片限制,早期算力有限、训练困难。还指出内部存在造假、套壳等问题,如135B V2套壳Qwen 1.5 110B,pangu pro moe 72B套壳qwen 2.5的14b等,导致人才流失。

Agent的潜意识
算法论文8

无需标注和奖励模型!仅靠自信度RL,16个样本训练20步,效果飙升21%!

论文提出RLSC,让大语言模型用自身答案置信度作奖励信号,摆脱人类标注依赖。它以模型自信度内部信号替代多数投票外部信号,小成本提升模型数学能力,还让模型学会快推理,不过也存在安全隐忧。

深度学习自然语言处理
开源动态8

32B 稠密模型推理能力超越 R1?中国秘密 AI 团队发布推理小模型 AM-Thinking-v1

2025年,国内神秘A - M - team在Hugging Face开源32B推理模型AM - Thinking - v1。它在多推理评测中击败DeepSeek - R1,与超大规模模型成绩相当。团队靠后训练方案挖掘32B模型潜力,探索小体量实现大能力路径。

AI科技评论
开源动态8

CVPR 2026 | AI寒武纪时刻?字节世界模型新作,仅靠视觉学习真实世界知识

豆包大模型团队与北京交通大学联合提出视觉世界模型 “VideoWorld 2”,无需依赖语言模型,仅靠视觉信息让机器掌握复杂能力。它能完成复杂手工任务,成功率远超主流模型,代码与模型已开源。

机器之心
算法论文7

英伟达放话:小模型才是Agent的未来!

英伟达论文指出,当前用大模型构建AI Agent是资源浪费,提出小模型才是Agentic AI未来,给出三点理由,还提供从大模型迁移到小模型的六步流程,并分析三个开源项目,呼吁行业追求效能。

探索AGI