多语言数据集」共找到 6485 篇相关文章

开源动态8

恐怖的 361k+ star!这应该是我见过最给力的宝藏项目,全网最全!

介绍GitHub上的开源项目`free-programming-books`,它汇集海量免费编程学习资源,涵盖编程语言、框架、工具等方面,有361k+ star。资源广、更新快、结构清、支持语言,使用简单。

开源先锋
开源动态7

吴恩达开源的OpenWorker,为什么「不 Work」了?

美国时间7月23日,吴恩达与Rohit Prasad发布开源桌面Agent OpenWorker。它把Agent工作流压缩成桌面应用,但上线一周暴露出模型兼容、数据流向和权限控制等问题,反映出Agent赛道走向成熟产品的挑战。

AI科技评论
开源动态8

新型开源端到端 AI 语音模型!Voila:195ms 超低延迟引领全双工对话!

Maitrix团队发布开源AI端到端语音模型Voila,以195ms超低延迟及全双工对话受关注。它功能强大,支持语言,有种使用方式,适用于个场景,架构采用模块化设计。

开源星探
开源动态8

谷歌开源高效文本提取 Python 库LangExtract

谷歌开源 Python 库 LangExtract,能用大语言模型从非结构化文本提取结构化信息。它定位精确、输出可靠,支持模型,适应领域,还能处理长文档,通过示例介绍了使用方法。

GitHubStore
开源动态7

以小博大,仅1.7B媲美gemini2.5-pro,达到SOTA文档解析性能

dots.ocr是语言开源文档解析器,把布局检测和内容识别统一在视觉语言模型中,虽LLM仅1.7B参数,却达SOTA性能。介绍了其预训练三阶段及SFT阶段关键策略。

PaperAgent
开源动态8

刚刚,DeepSeek模态技术范式公布,以视觉原语思考

DeepSeek发布模态模型并公布技术报告,提出‘以视觉原语思考’。该模型解决模态大模型‘指代鸿沟’问题,有把坐标变思维单元、7056倍视觉压缩、精心设计冷启动数据等创新,实验在任务上超主流模型。

机器之心
开源动态8

Suno最强开源对手来了!ACE Studio和阶跃星辰联合开源了一款音乐模型,20秒即可生成4分钟神曲!

ACE Studio和阶跃星辰联合开源音乐模型ACE - Step,参数量3.5B,结合种技术,支持语言风格音乐生成。20秒可生成4分钟歌曲,比传统模型快15倍,有种功能亮点,还介绍了上手步骤和应用场景。

开源星探
开源动态8

超越纯视觉模型!不改VLM标准架构,实现像素级深度预测

Meta开源DepthLM,首证视觉语言模型不改架构,也能媲美纯视觉模型的3D理解能力。它通过视觉提示等策略,解锁VLM任务处理潜力,为自动驾驶等领域带来前景。

新智元
开源动态8

超越纯视觉模型!不改VLM标准架构,实现像素级深度预测

Meta开源DepthLM,首证视觉语言模型不改架构就能媲美纯视觉模型的3D理解能力。通过视觉提示等创新策略,它精准完成像素级深度估计等任务,为领域带来前景。

新智元
算法论文7

从BERT到T5再到Qwen3:关于Embedding的八点总结

哈工大30+页综述聚焦通用文本嵌入(GPTE),系统介绍其架构、数据、模型,探讨预训练语言模型(PLM)给GPTE带来的基础能力与高级扩展,还涉及模态、语言、代码嵌入等应用。

PaperAgent