「M1模型」共找到 8405 篇相关文章
智谱开源GLM-4.5工具调用超越Claude Opus 4.1,成本仅1.4%
开源模型GLM-4.5在伯克利工具使用榜单上超越Claude Opus 4.1,运行相同任务成本仅为1.4%。它采用MoE架构,在多场景表现卓越,推理速度快,成本低,还接入多款主流编程工具。
Cursor 1.3 ~ 1.6 版本更新全梳理:终端不再挂、Agent 更聪明、上下文更可控
Cursor 1.3 - 1.6 版本有诸多更新。如自定义斜杠命令、改进 Agent 终端、升级 Agent 能力、增加左侧边栏管理等,还在上下文控制、工作流保护、MCP 资源支持等方面有优化。
0.005%参数量超越SOTA!提升模型能力无需庞大奖励模型
上海交通大学等校联合团队提出轻量级奖励模型SWIFT,利用大模型隐藏状态线性特征,仅训练极小线性层,在推理任务中超越主流奖励模型,实现计算效率与准确率双提升,且在多领域表现出色。
谷歌Gemini 3.1新模型深夜掀桌, 每秒狂飙363 token! 1/4价格暴击Claude
谷歌深夜推出Gemini 3.1 Flash-Lite,输出速度363 token/s,价格仅0.25美元/百万Token,跑分碾压GPT-5 mini和Claude 4.5 Haiku。开发者可通过Google AI Studio体验,企业用户可通过Vertex AI接入。
一个模型读懂所有医学数据,Hulu-Med探索医学大模型开源新范式 | 浙大x上交xUIUC
Hulu - Med是浙大、上交、UIUC等联合提出的通用医学视觉语言大模型,首次在单一模型统一理解医学多类数据。它开源透明,训练成本低,性能媲美GPT - 4.1,为医学AI带来新范式。
用 1/1000 的参数打穿大模型:我为什么强烈推荐 PaddleOCR
PaddleOCR是百度开源的OCR工具,模型参数仅0.07B,却能在复杂场景媲美大模型精度。其新一代PP - OCRv5全面升级,在文本检测等方面表现出色,还稳定增长且在海外受关注。
何恺明首个语言模型:105M参数,不走GPT自回归老路
何恺明团队推出全新连续扩散语言模型ELF,不走GPT自回归老路。它将生成过程留在连续embedding空间,最后离散化变回token。ELF用较少参数、训练token和采样步数,跑赢主流扩散语言模型。
让大模型“吃一堑长一智”,南理工百度等提出模型记忆新方法
南京理工大学联合百度等提出新方法ViLoMem,构建视觉流+逻辑流的双流语义记忆,让模型“从错误中学习”。它能在多模态基准提升模型表现,强模型记忆还可迁移给小模型。
端到端语音模型:从语音表征到模型架构
本文整理自阶跃星辰语音模型负责人杨学锐在2025年QCon全球软件开发大会的分享。介绍大模型对语音技术的重塑,涵盖识别、合成等方面;阐述端到端语音模型构建,涉及表征、架构、训推和任务;还提及模型评估方法。
Nature发布Delphi-2M模型,提前20年预测你得什么病
2025年9月17日《自然》发表研究成果,欧洲、德国和丹麦科学家改造GPT架构,推出Delphi - 2M模型。它能预测1258种疾病及死亡风险,依据过往病史等提供风险概率,虽有局限但潜力大。