多语言模型」共找到 9728 篇相关文章

开源动态8

基于闪电注意力机制,创新高效开源大模型

传统Transformer架构处理长文本和复杂推理任务有效率瓶颈,数领先模型仍依赖传统注意力设计。MiniMax开源基于闪电注意力机制的专家混合模型Minimax,从架构、创新模块、训练框架等方面优化,表现突出。

AIGC开放社区
新闻资讯8

世界模型双冠王诞生!国产世界模型力压谷歌、英伟达等持续领跑

近日,Manifold AI 研发的世界模型 Worldscape 0.2 在 WorldArena 榜单夺冠,此前 WorldScape 0.1 也登顶 WorldScore。该模型参数规模小,进化靠 MoE 架构,展现国产世界模型实力。

机器之心
推荐文章8

模型微调评测入门:看懂这些指标,才知道模型好不好

文章指出大模型微调中很新手重“调”轻“评”,评测是决定模型落地的关键。介绍分类和生成任务评测指标,给出实操步骤,还说明如何综合判断模型好坏,最后展望评测技术朝自动化等方向发展。

机器学习AI算法工程
产品应用7

AI 驱动的代理金融工作台

Vibe-Trading 是 AI 驱动的代理金融工作台,能将自然语言请求转化为交易策略等。它有自然语言转策略、数据源、专家团队等核心能力,具备面向交易的深度研究等功能,还介绍了安装方式、环境变量和推荐模型

GitHubStore
算法论文8

只需一次指令微调,大模型变身全能专家天团,8B模型性能反超全微调基线 | ACL25 Oral

预训练大模型适应专业领域需高昂微调成本,稀疏混合专家架构虽能提升推理效率,但从头训练耗资源。浙大与Thomson Reuters团队提出SIMoE,单阶段微调就能升级大模型,还解决传统方法两大局限,在性能和效率上双突破。

量子位
开源动态7

Ultralytics & lightly-train:简化计算机视觉模型训练,无需标签

在计算机视觉领域,获取带标签数据成本高、耗时长。开源项目 lightly-train 用未标记图像和视频自监督预训练,减少标注成本与时间,可集成到现有训练管道,支持模型架构和应用场景。

机器学习AI算法工程
开源动态8

阿里Qwen3一口气开源个向量&排序模型,冲!

今天阿里正式开源Qwen3-Embedding和Qwen3-Reranker系列,为语言文本嵌入和相关性排序树立新标杆。提供0.6B/4B/8B三种版本,支持119种语言,在个数据集达先进性能,赋能种应用场景。

PaperAgent
算法论文8

“坏”数据让模型更“好”?重新审视数据过滤

传统观点认为大型语言模型预训练应过滤“坏数据”,但论文《When Bad Data Leads to Good Models》提出反直觉观点,适度加入有毒数据,通过后训练技术可降低模型毒性,保持一般能力,挑战常规做法。

深度学习自然语言处理
新闻资讯7

DeepSeek、GPT、Qwen,所有大模型架构图都有,Karpathy:宝藏画廊!

模型赛道热闹,架构创新,理解困难且缺清晰架构图。AI 研究者 Sebastian Raschka 绘制主流大模型结构,整理成在线图谱「LLM Architecture Gallery」,方便研究者查阅对比。

机器之心
算法论文8

Meta提出StepWiser,让模型学会“反思”自己的推理过程

Meta提出StepWiser解决大语言模型推理逻辑正确性问题。它训练生成式评判模型,通过强化学习在线训练,能解释推理步骤好坏。实验显示其远超传统方法,为构建可靠AI系统提供新思路。

深度学习自然语言处理