大语言模型」共找到 9286 篇相关文章

推荐文章8

万字长文!模型(LLM)推理优化技术总结(非常详细)

文章聚焦模型推理优化技术,介绍推理过程分预填充与解码阶段,还阐述模型并行、注意力机制优化、模型优化及服务技术等,如多查询注意力减少内存,FlashAttention 优化计算顺序。

AINLPer
新闻资讯8

云计算一哥首度牵手OpenAI,模型「选择」自由,才是终极胜利

亚马逊云科技宣布通过两平台支持OpenAI新开源模型,还上线Anthropic最新模型Claude Opus 4.1。其早有战略布局,两平台汇聚400+模型,践行‘选择于一切’理念,满足多样需求,打造AI生态。

机器之心
算法论文8

Speech LLM 的下一个突破口:你的语音模型可以是个「带韵律的文本模型

语音模型存在‘模态代沟’致性能‘降智’,此前两波改进未根本解决。香港中文学论文提出TextPro - SLM架构,从输入端破局,仅用约1000小时数据就实现低‘模态代沟’,对多模态模型设计有启发。

机器之心
开源动态8

AI操作网页:browser-use和AI模型互动解析

文章深入解析开源框架browser - use与AI模型互动方式。它能自动化在线任务,靠精巧prompt设计和不同类型Message输入实现高效交互,还总结出可用于其他模型交互场景的技巧。

阿里云开发者
算法论文8

模型“吃一堑长一智”,南理工百度等提出模型记忆新方法

南京理工学联合百度等提出新方法ViLoMem,构建视觉流+逻辑流的双流语义记忆,让模型“从错误中学习”。它能在多模态基准提升模型表现,强模型记忆还可迁移给小模型

量子位
开源动态8

阿里云通义点金发布DianJin-R1金融领域推理模型,32B模型荣膺榜首

阿里云通义点金团队与苏州学合作推出DianJin-R1金融领域推理模型,介绍其开源数据集与模型、基于通义点金平台的数据合成,展示了其在性能测试中的优异表现,推动金融科技智能化进程。

机器之心
新闻资讯7

语言模型内部还藏着众多策略模型?自底向上强化学习重塑底层特征 | 直播预约

现有强化学习工作将语言模型作整体策略优化,研究提出以策略视角审视内部隐藏状态,分析层级和模块级策略,发现不同模型模式差异,还提出自底向上强化学习策略,为研究架起新桥梁。

深度学习自然语言处理
新闻资讯7

印度国家级模型上线两天仅 300 余次下载,投资人直呼“尴尬”:韩国学生模型都有20万!

印度 Sarvam AI 发布国家级模型 Sarvam - M,虽被赞为本土 AI 突破,支持 10 种本地语言,但上线两天仅 334 次下载,投资人批其成绩尴尬,还与韩国学生模型对比,引发社区争论。

AI前线
新闻资讯7

2025全球模型应用报告:红海混战「忠诚度」瓦解,用户脚踏4.7条船!

2025年上半年模型从技术走向生产,45%企业将其用于生产环境。用户付费方式多样,使用面临知识不足、成本高的挑战。市场红海竞争,用户平均用4.7家模型,国产模型出海需借第三国。

新智元
算法论文8

Meta联合Google新作:语言模型到底“记”了多少东西?

Meta和Google合作的论文探讨现代语言模型对训练数据的“记忆”情况。研究发明新方法精确测量“记忆”量,发现模型记忆有上限且与参数线性相关,还揭示学习转折、隐私规律等重要结论。

深度学习自然语言处理