训练系统」共找到 3629 篇相关文章

开源动态7

24B模型编程超DeepSeek全家桶,32G内存苹果电脑就能跑,专门针对真实GitHub Issue训练

Mistral发布最新开源编程模型Devstral,参数24B,能在单卡RTX4090甚至32G内存Mac上运行。它专为编程智能体推出,针对真实GitHub Issue训练,在SWE - Bench Verified测试中表现出色,还可与All Hands AI框架配合。

量子位
开源动态8

DeepSeek-V3.1震撼发布,全球开源编程登顶!R1/V3首度合体,训练量暴增10倍

DeepSeek正式上线DeepSeek-V3.1,作为首款「混合推理」模型,将开启智能体新时代。它参数共671B,具强大智能体能力,编程击败Claude 4,训练量大幅扩增,在多方面测试表现出色,稳坐编程开源第一王座。

新智元
开源动态8

小红书hi lab首次开源文本大模型,训练资源不到Qwen2.5 72B 的四分之一

6月6日,小红书hi lab团队首次开源文本大模型dots.llm1,采用MIT许可证。该模型激活参数量140亿,总参数量1420亿,上下文长度32K。训练资源不到Qwen2.5 72B的四分之一,在多个测评中表现出色。

AI前线
产品应用8

基于大模型(LLM)的自选股智能分析系统,让AI帮你盯盘,每天自动推送分析报告

daily_stock_analysis是基于LLM的自选股智能分析系统,免费零成本运行,获6.3万Star。它多市场覆盖、聚合多源数据,自动生成决策报告并推送。有零成本运行等五大亮点,还给出上手步骤、适合人群。

机器学习AI算法工程
开源动态8

牛!小米开源「音频语言模型」,超1亿小时预训练时间,音频理解和输出能力是真顶!

小米推出开源音频语言模型MiMo - Audio,有超1亿小时预训练时间。它能理解音频,70亿参数模型在多基准测试达SOTA,音频理解超Gemini - 2.5 - Flash,复杂推理优于GPT - 4o - Audio,还支持多模态任务。

开源AI项目落地
算法论文8

清华孙茂松团队 × 深言科技:以解释作为训练信号,让 8B 模型在幻觉检测上反超闭源大模型

大语言模型幻觉问题待解,成本与算力需求攀升。清华孙茂松团队联合深言科技提出FaithLens模型,把幻觉检测提升为整体评估,以解释作为训练信号,8B模型在多任务上超闭源大模型。

AI科技评论
算法论文8

牛津VGG、港大、上交发布ELIP:超越CLIP等,多模态图片检索的增强视觉语言大模型预训练

牛津VGG、港大、上交大团队论文提出ELIP方法,用学术界资源增强视觉语言大模型预训练,用于文字 - 图片检索。该论文被大会接受并获最佳论文提名。ELIP可应用于多个大模型,实验显示能显著提升图片检索表现。

机器之心
新闻资讯8

他们从四家顶尖AI实验室辞职,打造能自己跑实验的AI系统,目标是让科学家实现Vibe Research

2026年初,Harsh Mehta和Behnam Neyshabur离开Anthropic,在旧金山注册Mirendil,6月25日公司亮相并完成2亿美元种子轮融资。团队来自四家顶尖机构,目标是构建自主处理AI研发问题的系统,降低AI研发门槛。

DeepTech深科技
算法论文8

字节最新大模型秘籍:只挑能有推理潜力的数据训练!1.3B模型无需标签自动挑选

字节Seed团队发布AttentionInfluence成果,用1.3B模型给7B模型选数据,无需训练和标签。通过比较基础与弱化模型损失差异评估数据影响,在多基准测试提升模型性能,还能结合分类器全面提升表现。

量子位
新闻资讯8

Nature公开谷歌IMO金牌模型技术细节!核心团队仅10人,一年给AI编出8000万道数学题训练

谷歌DeepMind的IMO金牌模型AlphaProof技术细节公开。团队规模小,核心成员是IMO金牌得主。它把数学证明当游戏,用30亿参数模型和改进树搜索算法。训练难题靠自动形式化解决,赛场用TTRL突破,已开放使用。

量子位