「训练可用度」共找到 5654 篇相关文章
不看后悔!GitHub 开源 MultiTalk .8k star 强大的人语音+图像绑定项目
MultiTalk 是 MeiGen‑AI 开发的开源框架,可从音频、图片和提示语生成多人对话视频。它解决传统视频制作痛点,功能亮点多,技术优势明显,应用场景广,与同类项目对比表现突出。
告别Reasoning模型的“灵光一现”,推理能力可控了
当前GPT - 4o、DeepSeek - R1等大模型推理的‘高级操作’随机触发,不可控。研究者受经典推理三要素启发,教会模型三种‘元能力’,经三阶段训练,模型效果提升,让推理能力可控。
Hugging Face刚刚开源了一个MCP全面指南~
Hugging Face推出免费开源的MCP课程,涵盖从理论学习到实践应用的内容。介绍了无MCP时开发的复杂情况,以及使用MCP可降低集成复杂性和维护负担,还说明了MCP架构的组件。
刚刚,北京建了一座AI工厂:目标10万P算力,日产10万亿Token!
九章云极在2026全球智算科技峰会发布AI工厂战略,含训练和Token工厂,目标10万P算力、日产10万亿Token。用DCU度量投入,Token度量产出,重构智能生产与交付体系,适配不同企业需求。
阿里批准林俊旸离职,CTO周靖人接管千问!Gemini周浩确定加盟
阿里巴巴CEO吴泳铭批准林俊旸辞职,周靖人接管千问。此次人事变动突然,引发诸多猜测。阿里高层称是为扩充团队、投入资源。Gemini 3.0核心贡献者周浩据传将主导千问后训练。
从零开始200行python代码实现LLM
文章从传统思路实现诗词生成器入手,介绍了词汇表、Bigram模型等概念,接着用Python和PyTorch实现了真正的Bigram模型,阐述模型、训练等内容,最后回顾成果,下一篇将基于此实现完整GPT。
LLM省钱大测评!48块GH200,首个百亿级参数量实证
EfficientLLM项目聚焦LLM效率,提出三轴分类法和六大指标,实验覆盖多方面。研究表明效率优化需权衡,最优策略因任务和模型规模而异,且相关技术可迁移到跨模态模型,成果将开源。
LLM的“记忆外挂”来了!Supermemory新API:一行代码让LLM记忆“无限+省钱90%”
Supermemory公司发布Infinite Chat API,能让任何LLM有近乎无限上下文长度。用户一行代码就能切换,可扩展上下文、省90%成本、提性能,已上线,有免费试用额度,后续有固定费用和用量计费。
The Batch: 897 | 科学实验室的通用语言
上海人工智能实验室发布开源的 Science Context Protocol (SCP),它能连接 AI 智能体与多设备进行自动化科学探究。相比 MCP,其结构更安全,可管理模拟和实体实验,促进跨学科合作。
GPT-5 最强大的,是编程
据报道,OpenAI的GPT - 5即将到来且早期反馈积极。它在编程领域表现突出,尤其在实际编程任务上有提升,不过其具体形式存疑,改进或多来自后训练阶段的强化学习。