SFT训练集」共找到 2530 篇相关文章

算法论文8

大模型破译甲骨文创下新SOTA!复旦团队推出新框架

复旦大学团队提出基于部首和象形分析的可解释甲骨文破译框架,构建PD - OBS数据。该框架在公开基准数据上准确率高,零样本破译能力强,能输出可解释分析文本,助力考古破译。

量子位
开源动态7

付费Mathpix公式识别不香了~不要钱舒服!

复杂科学文献中公式识别问题重要,但现有模型有局限。DocTron - Formula通过简单微调在多场景达先进水平,还引入CSFormula数据。它基于Qwen2.5 - VL微调,在多个数据上效果佳。

CourseAI
开源动态8

Qwen-Scope:看穿大模型的“小心思”

Qwen-Scope是基于Qwen3和Qwen3.5系列模型训练的可解释性模块,通过在隐藏层插入SAE提取可解释特征。它能分析模型行为、优化模型,应用于推理、数据、训练、评估等场景,可前往Huggingface或魔搭体验。

千问大模型
算法论文8

10步优化超越强化学习,仅需1条未标注数据!后训练强势破局

无监督的熵最小化(EM)方法仅需一条未标注数据和约10步优化,就能显著提升大模型在推理任务上的表现,甚至超越依赖大量数据和复杂奖励机制的强化学习(RL)。EM为大模型后训练提供了更高效简洁的新思路。

新智元
新闻资讯8

Ilya交卷!黄仁勋砸50亿押注SSI,首个模型疑本周发布

Ilya Sutskever创立的SSI或本周发布首个重磅模型,引发圈内关注。英伟达砸50亿美元合作,提升其算力。该模型基于测试时训练架构,能边学边进化,或终结大模型“预训练时代”。

新智元
开源动态8

刷新世界记录!40B模型+20万亿token,散户组团挑战算力霸权

Nous Research推出Psyche网络,用区块链汇聚全球计算资源,启动40B参数大语言模型Consilience预训练,达20万亿token创纪录。还解决带宽瓶颈等问题,让AI训练去中心化,推动创新与民主化。

新智元
产品应用7

字节跳动Seed1.5-VL复杂图表精准抽取,Deep Think是多模态未来的主流

文章介绍字节跳动的Seed1.5-VL模型,它能精准抽取复杂图表,处理模糊图片、推理几何题。其由视觉编码器和LLM组成,预训练语料丰富,后训练结合多种方法,推荐在huggingface体验。

CourseAI
产品应用8

The Batch: 968 | Muse Code 想获取你的数据

Meta推出Muse Code编码框架及Muse Spark 1.2模型,有不同输入输出、功能和性能表现。提供不同档位价格,贡献者档位低价但数据用于训练。测试显示其单任务成本低,Meta此举或为获取编码训练数据。

DeeplearningAI
算法论文8

大模型破译甲骨文创下新SOTA!复旦团队推出新框架

复旦大学团队提出基于部首和象形分析的可解释甲骨文破译框架,构建PD - OBS数据。该框架在公开基准数据上准确率高,零样本破译能力强,还能为未破译甲骨文输出可解释分析文本,助力考古工作。

量子位
新闻资讯8

LeCun点赞:国产开源模型占领硅谷,性价比超10倍

硅谷被中国开源模型占领,Cursor、Cognition等公司模型被曝套壳或基于中国开源模型后训练。巨头如Meta也用Qwen做训练,爱彼迎等青睐Qwen。因性价比高,中国开源模型在硅谷走红。

量子位