语音数据集」共找到 2815 篇相关文章

算法论文7

LLM又曝致命缺陷:根本不会看时钟!博士惊呆,准确率不及50%

最新研究揭示AI存在认知缺陷,读取时钟准确率仅38.7%,判断日历日期准确率26.3%。研究者构建测试考察MLLM能力,虽部分模型有亮点,但整体表现不佳,凸显训练数据和推理方式改进需求。

新智元
产品应用8

AnyGen款新AI工具,专门解决打工人最头疼的3件事,Doc,PPT,Excel

字节跳动2025年12月在海外推出一站式AI协作工作台AnyGen,强调人机协作打磨。产品有文档、通用智能体、幻灯片、数据分析四个核心模块,能解决会议纪要整理、PPT制作等痛点,还与主流工具做了横评。

AI Reading Hub
推荐文章8

这一年做 Agent 的公司,Coding 赚了钱,客服融了钱,你呢?

全球数据研究机构 CB Insights《AI Agent Bible》报告梳理 Agent 行业概况。指出未来趋势,如语音成主流交互等;分析发展受限问题、有潜力机会;还介绍不同类型 Agent 商业情况及应对推理成本策略等。

Founder Park
开源动态8

让大模型理解真实医疗视频,全球首个开源技术方案来了!

AI 进入医疗领域需谨慎,此前美国引入不成熟 AI 致手术失误频发。全球首个医疗视频理解大模型元智医疗视频理解大模型发布并开源,解决了医疗视频领域的任务优化、数据缺失和无法评测痛点。

机器之心
算法论文8

《TAML》好文推荐 | 来自清华大学张宇飞团队最新研究成果 基于文本生成翼型:FoilCLIP,一种语言驱动的气动设计新框架

传统翼型设计依赖CFD和风洞试验,成本高。清华大学张宇飞团队提出端到端双向映射框架FoilCLIP,通过对比学习建立文本与翼型几何双向映射,还提出数据增强策略,验证了其在语言驱动设计中的应用潜力。

力学与人工智能
算法论文8

LLM-based Reranker效果到底如何?一项关于SoTA模型的全面分析

在信息爆炸时代,重排序是信息检索系统核心。论文对22种重排序方法实证研究,构建无污染数据FutureQueryEval。结果显示LLM重排序器泛化能力被高估,轻量级模型有优势,为研究和应用提供指南。

深度学习自然语言处理
算法论文8

Thinking Machines新发现:Lora不是权宜之计,哪怕秩低到 1,也能匹敌全参数微调

Thinking Machines和John Schulman新研究刷新对LoRA的认知,实验显示正确使用时它能匹敌全量微调。团队系统研究训练与参数关系,有层选择、学习率等关键发现,还给出实用建议,但LoRA在部分场景表现待验证。

AI工程化
开源动态8

港中文联手美团开源“视觉推理通才”!图像视频10类任务一网打尽

香港中文大学MMLab与美团研究团队开源OneThinker模型,它可覆盖图像与视频十类核心视觉任务,在31项测试中表现出色,还展现泛化能力。研究团队搭建数据,并引入EMA - GRPO算法提升训练稳定性。

量子位
开源动态8

视频生成Prompt何须仅是文字!字节&港中文发布Video-As-Prompt

AI视频生成中,依赖抽象语义控制的创作因缺乏统一条件表征而困难。字节与港中文团队提出Video - As - Prompt框架,引入‘视频参考’范式,实现抽象语义下可控视频生成范式统一,代码和数据已开源。

机器之心
开源动态8

告别AI“乱画图表”!港中文团队发布首个结构化图像生成编辑系统

现有AI生图工具在结构化图像生成上问题多,理解与生成能力有鸿沟。港中文等校联合团队提出首个综合性方案,涵盖数据构建、模型优化、评估基准三大模块,助多模态模型画准图,推动其发展。

量子位