打包工具」共找到 1231 篇相关文章

新闻资讯8

谁说老实人赚不到钱?Claude用一张3500亿的支票脸OpenAI

2026开年,Anthropic计划融资100亿美金,估值从1830亿涨至3500亿。曾因理念分歧从OpenAI出走的Amodei兄妹,带领Anthropic专注技术与AI安全,在营收、性能等方面反超OpenAI,上演逆袭。

新智元
算法论文8

让 AI 自己怪升级,Meta用Self-play RL把Coding推向超级智能

Meta FAIR、Meta TBD Lab等朝着“超级智能软件工程Agent”迈出第一步。SSR让大模型零人类标注,靠自生成Bug和自修复稳定碾压人类数据基线,新旧范式对比优势明显,还介绍方法、实验结果与理论洞察。

PaperAgent
新闻资讯7

脸哲学无用!牛津博士教出Claude,自曝百万年薪提示词秘诀

Anthropic驻场哲学家Amanda Askell主导设计Claude的性格等机制,她分享制定有效AI提示词方法,认为需哲学思维。此外还提及不同人对提示词看法,以及大模型存在的「裂脑问题」。

新智元
算法论文8

自适应Agent基础模型:从“会推理/会用工”到“懂得取舍的执行者”

当前大型语言模型在智能体/工调用场景有推理型和工型两类,存在效率与功能、深度的矛盾。A²FM框架提出多模式自适应路由,实现模式自适应切换,在多基准测试中效果与效率双升。

深度学习自然语言处理
算法论文8

Thinking Machine新研究刷屏!结合RL+微调优势,小模型训练更性价比了

Thinking Machine新研究提出On - Policy Distillation方法,结合RL与微调优势。该方法让学生模型每步由教师模型指导,用KL散度评估分歧。实验表明其训练小模型性价比高,还能解决AI“灾难性遗忘”问题。

量子位
推荐文章7

反常识!GPT-5和Opus 4同时翻车:AI越强,越不爱用工

作者用GPT - 5和Claude Opus 4做进化实验,让其开发工。两模型表现出色,但面对实际任务却不用自制工。原因包括模型规模使脚手架工作无价值、RLHF带来工厌恶、逼近AGI渐近线等。

探索AGI
算法论文8

大模型转行土木工程!首个「灰人」评估基准:检验读、改工程图纸能力

首个工程自动化任务评估基准DrafterBench,可测试大模型在土木工程图纸修改任务中的表现。它模拟真实工程命令,考察模型四方面能力。评测发现主流大模型有一定能力,但未达工程一线要求。

新智元
新闻资讯7

爆火AI编程Windsurf突遭Claude全面断供,开发者大量退订!直接脸OpenAI

AI编程工Windsurf突遭Anthropic切断Claude 3.x系列模型API访问权限,CEO称仅获五天通知。用户大量退订,Windsurf官方激烈回应,采取应对措施,AI编程领域大战正酣。

新智元
算法论文8

分器到思考者:RM-R1用推理重塑模型价值判断

伊利诺伊大学香槟分校团队提出 RM - R1 框架,将奖励建模定义为推理任务。它引入推理奖励模型和链式评估准则机制,经两阶段训练,在多基准测试中表现超大规模模型,验证了推理能力对奖励模型的重要性。

机器之心
产品应用8

实测字节扣子空间:AI 播客比真人丝滑,Agent 能 80% 的工

本文对字节跳动旗下 Agent「扣子空间」进行实测。它上线新玩法一键生成播客,相比通用 Agent 能力更丰富。此外,它还备搜图、深度分析、写代码、开发网站等功能,兼通用能力与低代码开发特点。

AI科技评论