「前端开发测试」共找到 3213 篇相关文章
国产模型新盛况!王座易主:Kimi K2 Thinking开源超闭源
月之暗面开源 Kimi K2 Thinking 模型,多方面性能超 GPT - 5 等闭源模型。它擅长多轮调用工具和持续思考,在多项基准测试达 SOTA 水平,成本低且授权宽松,引发全网讨论。
为什么说开发者参与鸿蒙生态共建是“恰逢其时”?
文章指出开发者参与鸿蒙生态共建恰逢其时。当前人均设备多,鸿蒙打破旧规则,生态加速生长。HarmonyOS开发者技术分论坛展示新机遇,介绍其开发能力、适配方案等,还阐述生态开放性与开源精神。
幸好图灵不是一位好棋手
本文讲述图灵因棋艺平庸常和唐纳德·米奇对弈,二人合作博弈树算法成AlphaGo核心。米奇受其影响成AI研究先驱,开发算法、程序,其对国际象棋残局的研究影响众多后来者。
我们给OpenClaw加了一双眼睛,来观察我们这平凡的一天。
内容创意组小伙伴用Pocket 3作OpenClaw的“眼睛”,俯拍工位区,截取图片喂给多模态模型描述场景,下班时让OpenClaw分析趣事。还开发了“OpenClaw人类观察计划”,开发过程简单,降低了Agent体验门槛。
Claude、GLM、GPT谁才是真正的AI软件工程师?首个持续更新Visual Spec-to-App Benchmark发布
近年来,Coding Agent 发展迅速,「AI 软件工程师」渐成现实。但目前缺少系统评测其从设计稿开发产品能力的公开 Benchmark。为此,多校研究团队推出 VISTA,可多维度评测 Coding Agent 开发能力,且持续更新。
Altman 投的 Agent 终端 Warp 开源了,15小时Star 数飙到3.5万!开源是延长软件寿命的最佳方式
由 Sam Altman 支持的现代终端 Warp 正式在 GitHub 开源,OpenAI 成新代码库创始赞助商。Warp 团队认为传统开发模式遇瓶颈,开源可汇集全球创意,还在功能上开放,引发社区热议。
Anthropic CPO:AI写9成代码后,我们迎来了新噩梦!
本文是对Anthropic CPO Mike Krieger的播客访谈。他谈到AI重塑软件开发,约90%代码由AI编写;还分享产品经理价值、Anthropic战略、Artifact关闭原因等,对AI认知从工具变为战略伙伴。
LLM工业级自进化:北邮与腾讯AI Lab提出MoE-CL架构,解决大模型持续学习核心痛点
北邮百家AI团队与腾讯AILab提出MoE - CL架构用于LLM自进化持续指令微调。其结合‘解耦LoRA专家’与‘GAN对抗降噪’,在腾讯业务及基准测试中效果佳,降低人工成本,准确率优于主流方法。
GPT-5仅23.3%,全球AI集体挂科!地狱级编程考试,夺金神话破灭
最新基准测试SWE-Bench Pro评估AI编程智能体,直面真实企业级工程任务。顶尖模型几乎溃败,GPT - 5仅23.3%。该测试解决现有基准数据污染、任务简单问题,能成未来LLM编码能力标尺。
Claude与人类共著论文,苹果再遭打脸!实验黑幕曝光
苹果一篇质疑大模型推理能力的论文引发争议。Open Philanthropy研究人员联手Anthropic发表论文,揭露苹果论文三大缺陷,指出部分测试无解却让模型“背锅”,还给出正确评价大模型推理能力的方法。