自研模型」共找到 8207 篇相关文章

新闻资讯7

“通用大模型微调成为行业模型是伪命题”?医疗 AI 深度重构,传神语联创始人何恩培:孪生智能体能砍 70% 线下复诊工作

本文为《2025年度盘点与趋势洞察》系列内容,传神语联创始人何恩培认为通用大模型微调成行业模型是伪命题。他表示孪生智能体能砍70%线下复诊工作,还分享了医疗AI发展、中医和西医落地方向及突破方向等见解。

AI前线
新闻资讯7

多模态扩散模型开始爆发,这次是高速可控还能学习推理的LaViDa

近期基于扩散模型的视觉 - 语言模型 LaViDa 出现,它继承扩散语言模型优点。与回归模型不同,扩散模型能并行、处理双向上下文。LaViDa 在多任务测试有竞争力,推理蒸馏和文本填空表现好,还能权衡速度与质量。

机器之心
算法论文8

除了prompting外,不动参数,如何改变模型行为?

文章指出传统提示工程控制大模型生成行为有缺陷,提出Steering Target Atoms (STA)方法。它用稀疏编码器分解LLM高维表示,定位“原子知识组件”精准控行为,实验效果超现有技术,还能控制推理长度。

深度学习自然语言处理
新闻资讯7

90% 应用已完成迁移!LinkedIn 宣布砍掉 Kafka,全面切换消息系统 Northguard!

领英宣布用消息系统 Northguard 取代 Kafka,还有虚拟化 Pub/Sub 层 Xinfra。Northguard 规模更大、架构优,Xinfra 能实现无缝迁移。超 90% 应用已完成迁移,领英还在考虑开源。

InfoQ
新闻资讯8

DeepSeek-R1登顶Nature,8位专家严审通过, 大模型「交卷时刻」来了

近日,DeepSeek - R1登上Nature封面,打破主流大模型未经过独立同行评审惯例。同行评审可理清模型机制,提升透明度与可信度,还能避免‘刷榜’‘评’,虽有公司担心泄密,但它是验证成果的必要程序。

新智元
推荐文章7

万字长文!大模型LLM推理优化技术总结

文章围绕大模型LLM推理优化技术展开,先介绍LLM推理各阶段、批处理、KV缓存等概念及内存需求,再阐述模型并行、注意力机制优化、模型优化和模型服务等技术,如Pipeline并行、MQA、量化、动态批处理等。

OpenMMLab
算法论文8

适应Agent基础模型:从“会推理/会用工具”到“懂得取舍的执行者”

当前大型语言模型在智能体/工具调用场景有推理型和工具型两类,存在效率与功能、深度的矛盾。A²FM框架提出多模式适应路由,实现模式适应切换,在多基准测试中效果与效率双升。

深度学习自然语言处理
算法论文7

AI集体“听不懂”!MMAR基准测试揭示音频大模型巨大短板

MMAR基准测试对30款音频相关模型进行测试,结果显示,多数开源模型面对复杂音频推理任务远未达实用水平,音乐任务中所有模型表现不佳,且有显式推理能力的模型表现更优。

量子位
开源动态8

以小博大!Nanbeige4-3B重磅开源:硬刚Qwen3,挑战小模型能力新高度

近年来大语言模型参数膨胀,成本升高,业界重注小语言模型。近日,Boss直聘南北阁大模型实验室发布仅30亿参数的Nanbeige4 - 3B,在多方面媲美甚至超越通义千问Qwen3系列模型,开源印证小模型潜力。

AIGC开放社区
算法论文8

NeurIPS 2025 Spotlight | 让检索、推理真正「合体」的小而强模型,AceSearcher来了

近期,多所高校究团队发布 AceSearcher 模型,它是让同一语言模型在推理时兼任双角色的合作式博弈框架,以两阶段训练为骨架,将推理与检索结合,提升复杂检索任务效果,在多任务上表现出色。

机器之心