多语言数据集」共找到 6485 篇相关文章

算法论文7

AI竟会「自己认错」?破解智能体协作「罗生门」,斩获ICML 2025 Spotlight

智能体AI系统任务失败后,开发者常难定位问题。PSU、杜克大学与谷歌DeepMind等机构提出「自动化失败归因」,发布Who&When数据集,探索三种归因方法,虽目前效果欠佳,但为打造可靠系统提供方向。

新智元
新闻资讯7

AI翻译的「最后一公里」

文章指出文化差异成AI翻译难题,通用大模型数据不平衡,存在“算法霸权”。如处理低资源语言,AI易产生幻觉,还因无肉身难理解基于生理体验的隐喻,人机协作才是翻译未来。

新智元
算法论文7

1100个模型殊途同归,指向一个「通用子空间」,柏拉图又赢一回?

约翰斯・霍普金斯大学研究发现,1100个不同神经网络,即便训练条件不同,最终权重会收敛到共享低维子空间,表明架构比数据影响大。此发现能解释诸现象,还有种应用可能,但也有局限性。

机器之心
产品应用8

阿里发布Qwen3-TTS:跨语言混合无缝切换,方言音色全面覆盖!

TTS技术从单一合成进化到模态表达,但传统模型在跨语言/方言混合场景有不足,商业工具费用高且不开源,开源方案训练数据少。阿里推出Qwen3 - TTS,实现人类级自然度和表现力,功能强大,应用场景

开源星探
开源动态8

智源研究院发布中英文高质量数据集CCI4.0,推动全球人工智能开源创新

2025年5月6日,智源研究院在全球开源创新论坛发布中英文高质量数据集CCI 4.0,同步在平台开源。CCI 4.0规模大,处理严格,此前CCI系列反响好,未来将持续建设中文预训练语料库。

AI科技大本营
开源动态8

让AI看懂科研图表:深势科技开源150万高质量科研图文数据

深势科技开源OmniScience数据集,含150万个高质量图文对。它利用先进工具攻克图文提取难题,经严格筛选成型,涵盖学科。还设计重写流水线提升图文语义契合度,基于此训练的模型表现优异。

AIGC开放社区
开源动态8

华为新开源!扩散语言模型突破32K上下文,还解锁了「慢思考」

今年文本生成领域从自回归向扩散语言模型转变,但长序列训练不稳定是痛点。华为发布 openPangu-R-7B-Diffusion,将上下文长度扩至 32K,在基准创 7B 参数量级 SOTA,还解析了其技术革新。

机器之心
推荐文章7

深入解析邻国的 FinOps 之旅:将云支出转化为工程洞察

邻国在《每位工程师都该了解的 FinOps》中分享实践经验,将财务意识融入工程流程,用成本可视化机制让开发者了解成本影响,采用相关指标平衡创新与效率,借助工具优化成本,行业正从‘削减成本’转向‘数据驱动责任制’。

InfoQ
开源动态8

无损加速视觉语言模型推理!轻松剪掉视觉冗余Token|腾讯AI Lab

图像、长视频让大型视觉语言模型推理成本暴涨,成算力瓶颈。腾讯AI Lab联合CMU提出VScan,通过两阶段视觉token筛选机制,在几乎不损性能的前提下实现推理加速,且已在GitHub开源。

量子位
推荐文章7

语言模型高考数学拿高分靠强化学习,那文科考高分得靠什么?

语言模型在高考数学拿高分靠强化学习,但文科题无标准答案,此方法行不通。豆包1.6系列高考文科全科获683分,靠训练数据、思维链、长上下文和模态直接读图等因素。

宝玉AI