参数化求解器」共找到 1472 篇相关文章

产品应用7

Unsloth发布Qwen3-VL本地运行和微调指南,修复隐藏bug

Unsloth团队修复Qwen3-VL系列模型聊天模板语法问题,重新上传GGUF量文件,使模型可本地稳定运行。介绍了不同规格模型硬件需求、表现,给出部署步骤、参数差异,还展示多模态能力测试,提供多种格式模型及微调工具。

AI工程化
算法论文8

让大模型学会“像人一样”查证真伪

伊利诺伊大学香槟分校等校研究团队提出训练框架Veri - R1,为大模型提供“在线查证”新范式。它借助在线强学习、精细奖励机制和高质量数据,让模型学会像人一样查证,在多数据集上表现出色。

深度学习自然语言处理
算法论文7

管你模型多大,250份有毒文档统统放倒,Anthropic:LLM比想象中脆弱

Anthropic等联合研究打破传统观念,只需250份恶意文档就能在参数规模从6亿到130亿的LLM中植入后门,且与模型规模及训练数据量无关。研究还测试了特定后门攻击,评估了多种训练配置。

机器之心
新闻资讯7

GLM-5架构曝光,智谱两日涨60%:采用DeepSeek同款稀疏注意力

GitHub代码确认GLM - 5架构细节,它采用DeepSeek - V3/V3.2架构,含稀疏注意力和多Token预测,参数量745B。OpenRouter上神秘「Pony Alpha」被指是其测试版,受消息影响智谱AI港股两日涨60%。

量子位
新闻资讯8

中国AI芯片大突围,DeepSeek V3.1引爆算力革命

DeepSeek V3.1发布,是中国AI技术自主性的战略突围。它有6850亿参数,采用UE8M0 FP8适配国产芯片,具混合推理架构、Agent能力等。其发布或重塑AI产业格局,推动国产芯片发展。

AIGC开放社区
算法论文8

北大团队提出 SHINE:将任意文本转为大模型 LoRA,仅需一次前向传播!

北大团队提出全新超网络架构 SHINE,仅需一次前向传播就能将任意文本转为大模型 LoRA 参数,支持多轮对话。该方法实用潜力大、架构创新高效,训练流程成熟,推理快速,为大模型持续学习提供新思路。

机器之心
开源动态8

准确回答视频细节!11B模型挑战视频理解「证据级」任务,开源可商用

近日,复旦大学邱锡鹏教授领衔的OpenMOSS团队联合模思智能开源11B参数的多模态视觉理解模型MOSS-VL。它能准确回答视频里可被验证的细节、时间、过程和空间关系,有六项证据级能力,架构设计独特,采用Apache2.0开源许可。

量子位
新闻资讯7

AI训练初创公司Mercor,年运收入4.5亿美元,冲击100亿美元估值

AI训练初创公司Mercor正洽谈C轮融资,目标估值100亿美元或更高。它为OpenAI等对接专家,还提供数据标注服务,年运营收入近4.5亿美元,但也面临Surge AI等对手竞争,OpenAI新平台或带来新威胁。

AIGC开放社区
算法论文8

AI哪怕答案正确,逻辑链却惨不忍睹,奥数级不等式证明成功率不到50%| 斯坦福&伯克利&MIT

斯坦福、伯克利、MIT等联合研究,系统评估29个大模型在奥数级不等式证明任务的能力。研究发现,模型答案正确多靠猜,推理漏洞多,参数大、思考久也不能提升推理严谨度,但自我反思和定理线索策略有改善效果。

量子位
新闻资讯8

同一天,百度、OpenAI双双发力高智能AI!先来实测一波原生全模态文心5.0

2025年,OpenAI凌晨更新GPT - 5系列,百度在世界大会发布文心5.0。它采用原生全模态统一建模技术,参数达2.4万亿,评测领先。实测表现佳,其技术在多方面突破,为大模型演进提供路径,助百度重回竞争中心。

机器之心