大模型开发」共找到 10003 篇相关文章

开源动态8

猛涨25k star!一键检测你的电脑能跑哪些模型

最近 Github 出现工具 `LLMFit`,用 Rust 编写,能自动检测硬件配置,判断模型能否流畅运行,推荐最优量化版本和运行模式。有一键硬件检测等特性,安装使用方便,降低本地部署门槛。

开源先锋
算法论文8

模型如何准确读懂图表?微软亚研院教它“看、动手、推理”

多模态模型处理结构化图像有误差放、推理难等问题。微软亚洲研究院等提出PixelCraft,以高保真图像处理与非线性多智能体推理为支柱,提升结构化图像理解性能,在多基准上有增益。

量子位
推荐文章7

一个“蠢问题”改写模型规则!Anthropic联创亲曝:瞄准Claude 5开发爆款应用,最强模型的价值会让人忽略成本负担

Anthropic联合创始人Jared Kaplan在YC分享Scaling Law对模型发展的影响及Claude模型意义。他指出Scaling Law源于问“蠢问题”,是推动AI进步核心动力,还给出产品构建建议,介绍Claude 4优化。

AI前线
新闻资讯8

新鲜出炉!斯坦福2025 CS336课程全公开:从零开始搓模型

斯坦福学2025年春季CS336课程“从头开始创造语言模型”课程和材料全公开。介绍了讲师信息,课程目标是引导学生开发语言模型,含5单元19门课,注重实践,还说明了学习该课程需具备的能力。

机器之心
新闻资讯8

新一代文心模型5.0正式发布,百度推高智能天花板

在2025百度世界会上,新一代文心模型5.0发布,采用全模态统一建模技术。它在LMArena榜单成绩优异,能力达世界第一梯队,有原生全模态、基础能力强等优势,还强化智能体能力。

深度学习自然语言处理
7

国产模型高考出分了:裸分683,选清华还是北

字节跳动Seed团队公布全球第一梯队模型“高考成绩”,Gemini理科655分排第一,豆包文科683分排第一、理科648分排第二。文章解析评测标准,分析各科目表现,还介绍豆包能力提升技术亮点。

量子位
开源动态8

破局模型训练黑盒,MegatronApp开源实现万亿参数「可视可控」训练

在2025上海QCon会上,算秩未来赵伯罕博士指出万亿级模型训练困境。上海期智研究院和算秩未来联合研发MegatronApp,以低入侵方式补齐链路,其四个模块形成闭环,让训练从黑盒变白盒,项目已开源。

InfoQ
新闻资讯7

一个“蠢问题”改写模型规则!Anthropic联创亲曝:瞄准Claude 5开发爆款应用,最强模型的价值会让人忽略成本负担

Anthropic联合创始人Jared Kaplan在YC分享Scaling Law对模型发展的影响及对Claude等模型的意义。他认为AI发展不平衡,建议构建未完全跑通的产品,还介绍了Claude 4优化,探讨人机协作等内容。

InfoQ
算法论文8

AAAI 2026|AP2O-Coder 让模型拥有「错题本」,像人类一样按题型高效刷题

在AI辅助Coding技术发展背景下,开源语言模型生成代码有运行错误。上交博士团队提出AP2O方法,构建AP2O - Coder框架,借鉴人类学习模式,经实验验证能提升模型性能、抑制错误、提高样本效率,还适配通用模型

机器之心
开源动态8

模型推理极限在哪里?微博开源3B小模型,比肩顶级闭源

微博新开源的VibeThinker - 3B小模型,将特定能力维度性能推向极限。它在数学竞赛、编程等可验证推理基准上表现优异,成绩直逼顶尖模型。其训练流程层层叠加,还提出参数压缩 - 覆盖假说。

AIGC开放社区