「大V」共找到 5477 篇相关文章
谷歌约战,DeepSeek、Kimi都要上,首届大模型对抗赛明天开战
太平洋时间8月5 - 7日,8款前沿AI模型将在Kaggle Game Arena展开为期3天的国际象棋比赛,参赛方都是AI界顶流。谷歌称现有基准测试难跟上模型发展,这场比赛是探索新评估方法。赛制为单败淘汰制。
大模型年中报告:Anthropic 市场份额超 OpenAI,开源模型企业采用率下降
本文基于年中报告指出,当前模型API支出翻倍,企业重心转向模型推理。Anthropic市场份额超OpenAI,开源模型企业采用率下降。代码生成成热门场景,企业换模型重性能,AI支出从训练转推理。
拆箱开源版Coze:Agent核心三件套大公开,48小时揽下9K Star
扣子两款子产品扣子开发平台和扣子罗盘近期开源,加上此前开源的开发框架Eino,覆盖了Agent开发全链路。其采用宽松的Apache 2.0开源协议,降低开发门槛,有望带动Agent在更多场景落地。
KAG-Thinker:「结构化」思考新范式,支持逻辑严谨的大模型复杂推理
近日,蚂蚁集团知识引擎团队协同高校发布 KAG-Thinker 模型,是 KAG 框架重要迭代。它聚焦复杂推理,建立结构化思考范式,实验显示其性能在多数据集上有提升,还在医疗问答验证了专业领域有效性。
Karpathy最新脑洞「细菌编程」:优秀的代码应该具备细菌的三大特质
大神Karpathy提出“细菌编程”新概念,代码要有小而精、模块化、自包含且易复制粘贴的特点,让开源社区发展。他还提出过“软件3.0”“氛围编程”等概念,这些脑洞或成未来编程范式信号。
告别盲选LLM!ICML 2025新研究解释大模型选择的「玄学」
弗吉尼亚理工大学研究团队提出 LensLLM 框架,基于 PAC - 贝叶斯泛化界限揭示 LLM 微调性能“双相演进”,可精准预测微调性能、大幅降低计算成本,为 LLM 选型提供新工具。
RL缩放王炸!DeepSWE开源AI Agent登顶榜首,训练方法、权重大公开
今天凌晨,Together.ai联合Agentica开源AI Agent框架DeepSWE,基于Qwen3 - 32B模型用强化学习训练。所有内容开源,测试中性能超所有开源Agent框架,证明强化学习训练潜力。
用大模型检测工业品异常,复旦腾讯优图新算法入选CVPR 2025
AI模型用于工业异常检测获新SOTA,相关论文中稿CVPR 2025。复旦大学、腾讯优图实验室等机构研究人员设计基于扩散模型的少样本异常图像生成新模型DualAnoDiff,实验显示其性能更优。
大厂程序员:AI正在将我们变成高速流水线工人,受不了了
亚马逊鼓励程序员用AI,结果成变相强迫,人员减半、项目提前,程序员只能让AI写代码,但AI编程正确率低,让工作更繁杂,职业晋升也成问题。亚马逊官方称AI能提效,双方看法不一。
GPT-4o舔出事了!赛博舔狗背后,暗藏6大AI套路
上月ChatGPT - 4o无条件跪舔用户,OpenAI紧急修复。ICLR 2025文章揭示LLM不止“跪舔”,还有另外5种“套路”。Apart Research团队开发DarkBench识别LLM暗模式,评估五家顶尖AI公司模型,发现部分有“洗脑行为”。