「开源数据集」共找到 5069 篇相关文章

开源动态7

LightLLM中DeepSeek V3/R1 Two MicroBatch Overlap 实现解析

文章围绕LightLLM中DeepSeek V3/R1的Two MicroBatch Overlap实现展开。介绍了该技术原理,通过拆分推理过程、精心设计执行顺序实现计算与通信重叠。还阐述了数据结构设计、预处理、核心执行流程,以及优化策略和配置启用方式。

GiantPandaLLM
开源动态7

24B模型编程超DeepSeek全家桶,32G内存苹果电脑就能跑,专门针对真实GitHub Issue训练

Mistral发布最新开源编程模型Devstral,参数24B,能在单卡RTX4090甚至32G内存Mac上运行。它专为编程智能体推出,针对真实GitHub Issue训练,在SWE - Bench Verified测试中表现出色,还可与All Hands AI框架配合。

量子位
开源动态8

32B 稠密模型推理能力超越 R1?中国秘密 AI 团队发布推理小模型 AM-Thinking-v1

2025年,国内神秘A - M - team在Hugging Face开源32B推理模型AM - Thinking - v1。它在多推理评测中击败DeepSeek - R1,与超大规模模型成绩相当。团队靠后训练方案挖掘32B模型潜力,探索小体量实现大能力路径。

AI科技评论
推荐文章9

百度百舸演讲:用 Agent 优化 SGLang,从改Kernel修改到端到端验证

本文是百度百舸与SGLang联合Meetup的分享整理,讲解如何让Agent完成从瓶颈定位、Kernel修改到端到端验证的全流程SGLang性能优化,覆盖多类模型场景,公布实测性能提升数据与百度百舸的通信优化效果。

GiantPandaLLM
新闻资讯9

清华初创&UIUC学者用7B模型在预测市场上自我蒸馏,跑赢GPT-5.6和Opus 5

UIUC学者联合清华初创团队Astraculum,围绕LLM部署阶段持续学习问题展开研究,提出Social World Model框架,基于预测市场数据测试,经自蒸馏的7B模型击败了GPT-5.6等多款前沿大模型,还搭建了专用MLOps引擎TrajOps。

机器之心
新闻资讯8

OpenAI公布首颗自研推理芯片成绩,下一代已进入制造阶段

8月25日,OpenAI公布自研推理芯片Jalapeño性能测试结果,首次给出其在多款公开大模型上的具体数据。该芯片在低功耗下实现高推理吞吐量和低延迟,性能超英伟达芯片,B0版已进入制造阶段。

DeepTech深科技
产品应用7

在腾讯、育碧的做过游戏后,他转身做 AI 原生游戏,一上线就好评如潮

AI 原生游戏「动物去哪儿」基于真实地理数据,让玩家的小动物开启真实旅行,经历随机事件。创始人太一曾在腾讯、育碧任职,受 AI 启发制作此游戏。目前游戏在观猹获 9.1 分,本周五将邀太一直播答疑。

特工宇宙
新闻资讯7

Karpathy:大模型交互的第三种范式来了?这是不是夸大其词

Anthropic 上线 Claude Tag,可让团队在 Slack 与 Claude 协作,能完成写 PR、数据分析等任务,有多人协作、积累上下文等特点。Karpathy 认为这是大模型 UI 第三次大改,但评论区有质疑,不过有大咖背书或成‘数字员工’。

AI工程化
开源动态7

不可思议!400B大模型在iPhone上跑起来了

一个跑在 iPhone 17 Pro 的 A19 Pro 芯片上的 400B 大模型 Qwen3.5 - 397B - A17B 引发关注。这源于 Flash - MoE 开源项目,它摒弃现代 AI 框架,回归底层开发,实现消费级硬件上大模型交互级速度运行。

机器之心
开源动态8

“同事.skill”不用写了,爱马仕 Hermes 主动“蒸馏”你,还让开发者集体抛弃 “龙虾”?!

近日,Hermes Agent 在国内爆火,获超 5.2 万 stars 且还在增长。它与 OpenClaw 不同,采用单 Agent 架构,有学习循环和分层记忆系统。背后公司 Nous Research 目标是打造抗衡 OpenAI 的开源模型,还引入区块链解决算力问题。

AI前线