「真机测试」共找到 2130 篇相关文章
刚刚,AI大牛Karpathy又提新概念:像细菌一样写代码?
AI大牛Andrej Karpathy继Vibe Coding后提出「细菌式编码」,受细菌代码启发,有小而精简、模块化、自包含特点,其核心是让代码利于共享。它适合快速原型开发,也有局限,建议兼顾两者。
知识类型视角切入,全面评测图像编辑模型推理能力:所有模型在「程序性推理」方面表现不佳
东南大学等团队提出KRIS - Bench,从知识类型视角对图像编辑模型推理能力评测。它分三大知识范畴、细化多种任务,设四维度评估指标,测10款模型,发现模型程序性推理等能力不足。
北大联手通义实验室发布ZeroSearch:成本暴降88%,无需搜索即可激活大语言模型的检索能力!
北大与通义实验室发布ZeroSearch框架,可无需真实搜索激活大语言模型检索能力。它引入大语言模型模拟搜索、采用结构化模板等策略,成本降88%,多项实验显示其性能超越基线与真实搜索方法。
当 AI 制造的谎言比真相更吸引人时,会发生什么?
过去假照片制作难,如今AI工具让造假人人可用。深度伪造或使虚假信息泛滥,影响政治,还会瓦解真相与信任。未来神话塑造可能比真相追寻更有影响力。
Claude 4 要来了!
AI专家在Anthropic前端配置发现Claude 4痕迹,其或有查看AI思考过程功能。当下OpenAI、Google、xAI等对手来势汹汹,Claude 4压力大,但可在可解释性等方面破局,预计5月22日公布。
Gemini 2.5 Pro强势更新并霸榜,Claude 3.7首次遭遇全方位碾压!
Google DeepMind推出的Gemini 2.5 Pro在LMArena各大排行榜全面登顶,实现文本、视觉、Web开发全方位霸榜,编码能力也大幅升级。虽有质疑,但短期内难有对手,还引发对Google I/O大会更多惊喜的期待。
Claude最强Fable 5.1发布!8项屠榜,最高降价45%,反蒸馏机制上线
Anthropic发布Fable 5.1和Mythos 5.1,8项基准测试夺冠,价格最高降45%。展示科研成果,如蛋白质设计、生成金星地图等。上线反蒸馏机制,防止篡改上下文,还给出替代方案。
The Batch: 972|Grok 的 Cursor 联盟获得回报
SpaceXAI发布与Cursor联合开发的视觉 - 语言模型Grok 4.6,已向开发者开放。介绍其输入/输出、特性等信息,阐述工作原理、性能表现,还提及相关新闻背景、重要原因及期望。
OpenAI 全面拥抱 Agentic-First,实测有点扎心
OpenAI发布GPT - 5.6系列,Sol定位长周期Agent,训练目标转向Agentic - First。但目前难以用上Sol,且其评测数据因计数规则差异大,还出现变身话痨、少说话和干完活难兼顾的问题。
一文搞懂Codex连接控制:iPhone,MacBook,Mac mini,远程服务器
文章详细介绍 Codex 连接控制的三类方式:把 Mac 当主机让其他设备控制、用 Mac 控制其他 Codex 主机、让 Codex 连接远程开发机/服务器,还提及相关设置及注意事项。