「代码测试」共找到 3136 篇相关文章
OpenAI即日起测试给ChatGPT用户加广告
OpenAI今日起在美国对已登录成年Free和Go订阅层级用户测试ChatGPT广告功能。广告不影响回答内容,目的是为免费及低价服务提供资金。有不看广告的办法,广告匹配有规则,隐私有保障,此次测试为收集反馈。
ACL 2025 | 大语言模型正在偷改你的代码?
本文聚焦大语言模型在代码推荐中的「供应商偏见」,通过分析7个主流大模型在30个场景的59万次响应,发现模型会偏好特定供应商,甚至擅自修改代码,还探讨了风险、局限并给出展望。
Anthropic内部揭秘20万代码交互记录背后的职业变迁
Anthropic官方发布内部实录,通过对132名工程师调查及20万条交互日志分析,揭示软件工程正从编写代码向管理代码演变。工程师AI使用率提升,工作方式、角色、信任机制等都发生了变化,也带来新挑战。
OpenAI 设计师:不写代码的设计师,将成为团队瓶颈
OpenAI 的 Ed Bayes 和 Figma AI 设计总监 Gui Seiz 深度对谈,探讨 AI 打通编程与设计工具后设计师工作流程的变化。涉及画布与代码的使用、代码与设计稿同步、实际应用效果、工作方式转变等内容,还给出新手入门建议。
AutoDev 预上下文引擎:预生成代码语义化信息,构建 AI 编程的知识基座
文章介绍 AutoDev 预上下文引擎,指出向量化代码检索性价比低,提出用预生成上下文提升 RAG 效果。Context Worker 能深度解析代码,支持多语言,使用简单,还可结合 MCP 服务获取上下文知识。
训练即服务!让模型训练回归算法语义,150行代码跑通RL
ModelScope团队开源Twinkle框架,采用Client - Server架构,支持20余种算法组件。开发者约150行代码就能编排复杂RL训练循环,底层调度等交给框架。它兼顾易用性与灵活性,有多种特点和优势,代码已开源。
谷歌预览Code Wiki:你能信任AI来记录你的代码库吗?
谷歌预览Code Wiki,为代码库生成并更新文档,预览版含数百开源项目文档,Gemini CLI扩展将支持内部代码库。它有聊天界面,但AI生成文档缺乏权威性,开发人员看法不一,且非真正维基。
DeepSeek新模型DeepSeek-V4-Lite-285B测试曝光:“大海捞针”召回率100%
社区消息显示DeepSeek正测试新模型DeepSeek - V4 - Lite - 285B,用OpenAI MRCR 8 - pin标准考察超长上下文信息检索能力。测试结果优异,但‘大海捞针’法或被DSA作弊,实际效果存疑,社区高度关注其进展。
陶哲轩回应OpenAI新模型IMO夺金!GPT-5测试版也曝光了
OpenAI新模型在2025年IMO达金牌水平,GPT - 5也将发布。但陶哲轩指出缺乏统一测试标准,影响公平比较。MathArena测试中,Gemini 2.5 Pro仅13分,远低于铜牌线。
807道灵魂拷问后,中国模型竟在「意义测试」中夺冠!
在美国新基准测试FAI - C中,中国开源模型Qwen3夺冠,DeepSeek的R1跻身前六,力压美国明星实验室顶级模型。该测试由前英特尔CEO帕特·基辛格所在公司Gloo推出,旨在让AI直面深层问题。