模型配置」共找到 7849 篇相关文章

开源动态8

普林斯顿团队领衔发布最强开源数学定理证明模型:32B性能大幅超越前代SOTA DeepSeek 671B

近日,普林斯顿大学牵头多机构推出开源数学定理证明模型 Goedel-Prover-V2。其 32B 旗舰模型在多基准测试超 DeepSeek-Prover-V2-671B,8B 小模型特定基准性能与之持平。该模型有三项关键创新,团队已公开模型及数据集。

机器之心
开源动态8

SOTA级的Embedding模型!F2LLM模型、数据、代码全部开源,人人可用

Embedding 模型应用广泛,但主流模型训练困难。蚂蚁集团与上海交大推出 F2LLM,含 0.6B、1.7B、4B 系列模型,仅用六百万数据微调基座,在 MTEB 榜单领先且完全开源。介绍了其数据、训练、测评等情况。

深度学习自然语言处理
新闻资讯8

AI 的下一个战场:端侧模型崛起

模型退烧,小模型接棒。腾讯、阿里等大厂纷纷官宣小模型成果,英伟达、OpenAI 等也有相关动作。端侧模型赛道广阔,但技术含量不低,面壁智能在端侧模型探索上成果丰硕,其 MiniCPM 系列不断迭代,还在多领域落地。

AI科技评论
新闻资讯7

最强Claude模型提前曝光!附带Anthropic三千份保密档案在线裸奔

向来标榜安全的Claude因权限配置失误,新模型Mythos提前曝光,还泄露3000份保密档案。Mythos比Opus 4.6更强,公司虽在测试但因安全风险限制发布,也有人质疑信息真实性。

量子位
新闻资讯7

LeCun离职后不止创一份业!押注与大模型不同的路线,加入硅谷初创董事会

离开Meta后,Yann LeCun创立AMI,还加入Logical Intelligence任技术研究委员会主席。该公司推能量 - 推理模型,与主流大模型路线不同,其Kona模型在数独测试上表现远超大模型

量子位
产品应用8

9.1K Star!这个工具把 Claude Code 的幸福感拉满了,终于不用手撸 JSON 配置了!

Claude Code等让开发者回归终端开发,但配置“反人类”。GitHub上的cc-switch工具基于Rust + Tauri开发,支持多款模型快速配置切换,有可视化面板及多种功能,还集成Skills库,大大提升使用体验。

开源星探
产品应用8

网易游戏 Tmax 平台实践:基于 Fluid 的云原生 AI 大模型推理加速架构

网易游戏打造 Tmax AI 机器学习平台,但大模型推理业务规模爆发带来资源弹性等挑战。经评估,选用 Fluid + AlluxioRuntime 构建三层架构,有自动预热等配置,带来性能、成本等多方面收益。

AI前线
推荐文章7

2025 年中丨大模型市场分析报告

这是《2025年中丨大模型市场分析报告》。指出基础大模型塑造计算未来,企业重心转向推理。Anthropic超OpenAI成市场头号玩家,开源模型采用趋缓,企业换模型重性能,AI支出从训练转向推理。

特工宇宙
算法论文8

告别单一大模型依赖!北航等机构发布综述:大语言模型集成(LLM Ensemble)

北航等机构发布的论文系统性回顾了LLM Ensemble领域进展,介绍分类法、相关问题、方法、基准、应用和未来方向。LLM Ensemble指推理阶段综合利用多模型优势,现有推理前、中、后三大集成范式。

PaperAgent
算法论文8

LLM内部竟藏着众多策略模型?自所&腾讯团队首次揭示大模型RL新机制

中国科学院自动化研究所与腾讯AI Lab团队,从可解释性分析出发,发现LLM内部含多个可采样内部策略,揭示不同模型推理熵模式,提出BuPO算法,在复杂推理任务上表现优于传统算法。

PaperAgent