Qwen2.5-0.5B」共找到 3948 篇相关文章

算法论文8

大模型化身苏格拉底:通过主动提问挖掘人机协作的深度

微软与南加州大学联合团队研究揭示激发大模型主动提问能力新范式。通过定义主动信息收集任务、提出强化微调策略,经实验验证该方法有效,使模型在多领域表现出色,重新定义大模型角色。

AIGC开放社区
算法论文8

如何将LLM的"思考习惯"迁移到视觉领域?

传统多模态模型处理复杂视觉推理能力不足,OVR团队以Qwen2.5 - VL - 7B为基础构建开源强化学习框架,成果模型OVR在12个基准测试刷新记录,揭示认知行为跨模态迁移三条黄金定律。

深度学习自然语言处理
算法论文8

数据智能体全景报告发布!你的数据智能体在哪个 Level?

大语言模型爆发让「数据智能体」应运而生,但概念笼统成发展绊脚石。由多顶尖机构组成的联合团队发布论文,首提 L0 - L5 六级自主性分级标准,还对现有研究回顾审视,指明挑战并描绘未来图景。

特工宇宙
推荐文章8

Anthropic:这样构建Agent,性能提升90%!

Anthropic分享从0到1构建多智能体DeepResearch系统的方法,该系统是Claude内置Research功能。干货多,涵盖架构设计、Prompt工程等。多智能体性能比单模型高90.2%,但烧钱,适合高价值复杂任务。

探索AGI
开源动态7

深度拆解 DeepSeek Harness 架构:AGI 的自进化,终于有了「后悔药」

8月13日,DeepSeek开放DeepSeek Harness v0.1开发者预览版,在Github获4.5万星。它提出“一切皆插件”概念,核心组件可插拔。还联合北大提出Cordis框架,解决组件插拔问题,但面临价格与组件膨胀挑战。

AI科技评论
新闻资讯8

不止AlphaFold,「药界ChatGPT」横空出世!华人女投资人深度揭秘

AI初创Chai Discovery宣布分子设计模型Chai-2重构药物设计逻辑,将抗体设计成功率从0.1%提升到16%,实现零样本设计。其联创认为这是范式革命,未来药神或成提示词工程师。

新智元
新闻资讯7

闹玩呢!首届大模型对抗赛,DeepSeek、Kimi第一轮被淘汰了

谷歌发起首届大模型国际象棋对抗赛,为期三天。参赛模型众多,首轮中 Gemini 2.5 Pro、o4 - mini、Grok 4 和 o3 以 4 - 0 战绩晋级半决赛,DeepSeek、Kimi 首轮被淘汰,目前 Grok 4 是夺冠热门。

机器之心
推荐文章8

大模型开发实战从入门到入坑:动手写一个MCP Server去理解MCP背后的技术原理

文章聚焦MCP协议,介绍其是规范应用向大模型提供上下文的开放协议,能让模型调用接口更简单、实现开发解耦。还深度解析技术原理,手把手教从0到1实现MCP Server,助读者理解背后技术。

阿里云开发者
算法论文8

英伟达再出手!新型混合架构模型问世,两大创新实现53.6倍吞吐提速

英伟达研究者提出新混合架构语言模型 Jet - Nemotron,在达 SOTA 全注意力模型精度时效率卓越,2B 版性能超 Qwen3 等,H100 GPU 上生成吞吐量最高加速 53.6 倍,基于 PostNAS 和 JetBlock 两大创新。

机器之心
新闻资讯8

全球首份大模型业绩报!MiniMax预判2026三大超级PMF,AI平台公司启程了

港交所上市52天,MiniMax交出IPO后首份年报,2026年2月ARR突破1.5亿美元,2025年营收同比增158.9%,毛利飙升437%、亏损率收窄。它产品密集迭代,还预判2026年有三个超级PMF,欲成AI平台型公司。

量子位