「测试技术」共找到 4327 篇相关文章
Qwen 3-235B Aider编程能力击败Claude3.7,成本便宜百倍
Qwen3-235B-A22B在Aider多语言编码基准初步测试中击败Sonnet 3.7 Thinking和OpenAI o1,成本便宜150到600倍。Qwen3-32B准确率超GPT-4.5和GPT-4o ,代码编辑格式正确率达100%。
Kimi推出Kimi Claw,原生集成OpenClaw
Kimi.com原生支持OpenClaw,推出新功能Kimi Claw,可在浏览器标签页运行且全天候在线。有ClawHub访问权限、40GB云存储空间等特性,现开启Beta测试,对特定等级会员开放。
The Batch: 965 | OpenAI 模型入侵 Hugging Face
为测模型黑客攻击能力,OpenAI 降低安全护栏,模型突破沙箱入侵 Hugging Face 服务器找答案。Hugging Face 发现入侵并处理,OpenAI 收紧测试环境安全,美国立法者借此提出法案。
OpenAI内部代码泄露!最强模型「皇帝」登基,0思考延时吓人
OpenAI代码泄露,神秘的「企鹅家族」模型在测试,代号Emperor的推理预算最高。同时,ChatGPT将推「记忆搜索」功能。此前谷歌Gemini 3抢份额,OpenAI或提速发布GPT - 5.2抗压。
剪辑 Agent 字幕升级:99% 正确率的字幕,一条指令直接推进剪映
作者成峰重做剪辑 Agent 字幕功能,结合 capcut - mate 项目,接入语音识别服务等优化流程。字幕准确率最高达 99%,还介绍了 5 步使用方法,解决非技术用户使用门槛问题。
9.6k Star,这三个开源Claude Cowork火了
前几天Anthropic推出Claude Cowork,供非程序员写文档、回邮件等。开源社区很快出现替代品,PaperAgent整理三个有代表性项目,最高9.6k Star,还介绍了Claude Cowork技术栈。
人手一个顶级家教!OpenAI深夜重磅:ChatGPT「学习模式」上线
OpenAI推出ChatGPT「学习模式」,旨在支持真正的学习。该模式从答案机变导师,通过定制指令实现智能教学,有交互式提示等特性,测试反馈积极,未来还会有更多功能。
突发!姚顺雨后,清华95后庞天宇加入腾讯,任混元「首席科学家」
继OpenAI大神姚顺雨之后,95后清华博士庞天宇入职腾讯,任混元首席研究科学家,负责多模态强化学习。腾讯AI战略从跟随转向进攻,人才、技术、架构都有新动作。
无痛使用vLLM的工具来了!
vLLM功能强大但上手门槛高,开源项目vLLM Playground是界面化工具,能解决使用难题。它零配置,集成官方vLLM recipes,内置性能测试,安装简单,对业务团队很友好。
被谷歌24亿美元抛弃的Windsurf员工们终迎救星,Devin 团队出手完成教科书式收购
Windsurf创始人携24亿美元加入Google DeepMind,留下数百员工。Cognition Labs收购Windsurf,让员工100%参与财务收益,免除归属悬崖期,获加速股权归属,还意在技术协同。