模型通用性」共找到 8239 篇相关文章

产品应用8

Qwen3.5实战教程:从0到1掌握本地部署与微调

阿里通义千问团队发布Qwen3.5系列小模型,打破“大模型=高成本”惯例。本文全面剖析该系列模型,涵盖核心特、本地部署实战、模型微调实战,还给出技术细节与问题解决办法。

机器学习AI算法工程
算法论文8

刚刚,加入腾讯的姚顺雨发表首篇Paper~

腾讯混元与复旦联合发表论文《CL-bench》,姚顺雨署名并全面细致审阅反馈。CL-BENCH 首次单独考‘现学现卖’,有独特设计原则、四大题型,其评分杜绝‘差不多’,还让 10 个前沿模型‘翻车’。

PaperAgent
产品应用7

Anthropic试图彻底杀死Harness Engineering。

Anthropic推出新产品Managed Agents,定位是帮用户做Harness。它指出Harness保鲜期短,自己维护不划算。技术上把Claude Agent SDK拆成三块,让Harness成可热插拔模块。不过通用Harness有局限,开源社区也有新路线。

探索AGI
开源动态8

字节开源了一款多模态神器!BAGEL上线,超越Qwen2.5-VL,媲美SD3!

多模态AI发展进入新阶段,字节跳动开源通用多模态大模型BAGEL。它支持多模态输入输出与思维链推理,能超Qwen2.5 - VL等,安装使用友好,有多种应用场景。

开源星探
新闻资讯8

Gemini证明数学新定理!全程没联网

Gemini内部数学版学霸模型FullProof全程不联网,帮数学家证明代数几何领域新定理,即0亏格映射到旗簇空间的motivic类等价结论。它埋下关键思路伏笔、独立给出反例,比Macaulay2更优。

量子位
产品应用7

Karpathy头疼的“AI游戏困境”,被这款15分钟出包的国产神器破解了

8月初Andrej Karpathy指出通用AI做游戏时,LLM无法高效审查工作的弱点。而国产平台Spellcaster能先解析自然语言确定游戏设计,15分钟出包,还内置测试员验证,团队想工程化落地新方向。

AI寒武纪
推荐文章9

深度|AI开始接管物理世界,谁来掌握新的入口?

本文为深度行业分析,围绕Anthropic推出的模型硬件标准MHS展开,探讨AI从虚拟屏幕切入真实物理世界、接入实验设备的产业进程,梳理核心挑战与未来竞争格局。

DeepTech深科技
产品应用7

蚂蚁集团发布KAG-Thinker,多跳问答慢思考,医疗领域拿下87分

在LLM问答领域,多跳问题存在局限,现有方法缺乏严谨等。KAG - Thinker是基于KAG框架的模型,将复杂问题分解,通过多模块优化知识获取,在医疗领域实用,稳定也出色。

PaperAgent
算法论文8

成本暴降88%!通义实验室、北大发布ZeroSearch,无需搜索即可激活LLM检索能力

信息检索能力对提升大语言模型推理表现至关重要,但现有方法在训练中面临文档质量不可控和搜索 API 成本高昂两大挑战。为此,通义实验室和北大提出 ZeroSearch 框架,无需真实搜索即可激活 LLM 检索能力,显著降低成本。

机器之心
算法论文8

警告:你的Agent可能无法"解决"真实世界的视觉问题

文章提出 AgentVista 评测基准,含 209 道任务,横跨 7 大领域 25 个子方向。评测 14 个主流模型,最强的 Gemini - 3 - Pro 准确率仅 27.27%,揭示多模态 Agent 在视觉理解、工具调用等方面挑战大。

深度学习自然语言处理