新模型Spud」共找到 9258 篇相关文章

开源动态8

一个模型读懂所有医学数据,Hulu-Med探索医学大模型开源范式 | 浙大x上交xUIUC

Hulu - Med是浙大、上交、UIUC等联合提出的通用医学视觉语言大模型,首次在单一模型统一理解医学多类数据。它开源透明,训练成本低,性能媲美GPT - 4.1,为医学AI带来范式。

量子位
产品应用7

国产游戏理解模型SOTA,对话逗逗AI CEO:开源模型+行业数据是突破关键

2025年末国产开源模型影响力凸显,东京电玩展上逗逗AI的游戏理解模型LynkSoul VLM v1超顶尖闭源模型。其CEO刘斌表示,开源模型结合行业数据是突破关键,还探讨了产品技术、交互及发展趋势等。

量子位
算法论文8

陈丹琦作:大模型强化学习的第三条路,8B小模型超越GPT-4o

陈丹琦团队提出结合RLHF和RLVR优点的RLMT方法,支持在基础模型上直接使用,节省后训练成本。它让模型生成CoT,用奖励模型评价输出,使小模型超越大模型,推理更像人类。

量子位
开源动态7

DeepSeek 模型 R1-0528 悄悄开源,与o3 相当,实测来了。

DeepSeek团队悄无声息地在Hugging Face上开源推理模型升级版DeepSeek R1-0528,基于DeepSeek-V3-0324模型,架构和训练方法有改进,性能与o3相当,实测表现不错。

AI进修生
新闻资讯7

分化、范式、Agent 与全球 AI 竞赛,中国模型主力选手们的 2026 预测

AGI-Next 2026活动聚集众多国内大模型核心人物,「海外独角兽」总结出40条重要判断。涉及模型分化、范式(自主学习、原生多模态)、Agent、全球AI竞赛等方面内容,对AI未来发展趋势做出探讨。

Founder Park
算法论文7

Google 论文离谱到家了,0延迟0成本通用,提升大模型准确率最简单的方法。

Google论文提出简单提升大模型准确率的方法,即重复提示词,把完全一致的输入连续发2次。主流模型适用,经70项benchmark测试,0场景效果倒退,47个场景准确率提升,且几乎不增延迟、成本。

探索AGI
算法论文8

DiffMoE:动态Token选择助力扩散模型性能飞跃,快手&清华团队打造视觉生成标杆!

清华大学和快手可灵团队推出DiffMoE,通过创的动态token选择机制和全局token池设计,拓展了扩散模型的效率与性能边界。实验表明,DiffMoE在多方面超越现有模型,未来集成先进技术或有增益。

机器之心
新闻资讯7

Karpathy盛赞DeepSeek-OCR“淘汰”tokenizer!实测如何用Claude Code 让模型跑在N卡上

DeepSeek发布模型DeepSeek - OCR,在实用场景达SOTA且token消耗最少。Karpathy赞其或淘汰tokenizer,Pleiasfr联合创始人称是里程碑。开发者Simon用Claude Code让模型在NVIDIA Spark上跑通。

InfoQ
算法论文7

DeepSeek-R1推理智能从哪儿来?谷歌研究:模型内心多个角色吵翻了

过去两年大模型推理能力跃迁,谷歌等机构研究指出,推理能力提升源于模型推理时隐式模拟类多智能体交互结构“思维社会”,还提出利用“群体智慧”方向,并介绍了研究方法、实验结果等。

AINLPer
算法论文8

别再用单选评测骗自己了!Amazon论文揭示了大模型在多选题中的3种系统性偏差

Amazon论文揭示大模型做多选题有3种系统性偏差,如选择、数量、猜测偏差。还推出SATA - Bench评测,给出10个测量指标,提出Choice Funnel解码策略,能提升小模型多选题正确率。

深度学习自然语言处理