「测试全流程」共找到 3890 篇相关文章
少 61% Token、多10倍成功率,这个终端 AI 编程代理火了!
现在多数AI编程工具问题多,而在Github上火爆的`oh-my-pi`是运行在终端的AI编程代理,有哈希锚定编辑等实用功能,支持多模型,经基准测试效果好,还能解决实际开发痛点。
大基金投资,安徽又跑出一家芯片IPO
4月10日,全芯智造IPO辅导状态更新为“辅导验收”。这家成立不到七年的制造类EDA企业,创始人是行业“老兵”倪捷,技术覆盖制造关键环节,虽营收破5亿但净亏超3亿,获大基金等投资,有望推动国产替代。
沃顿教授警告:老板用AI正偷偷赚钱,而你还在审它做的17份PPT?
AI跨越关键门槛能完成有经济价值的工作,但也可能产生大量无用内容。OpenAI新测试显示大模型进步快,虽暂难取代人类工作,但智能体工作续航能力大增,人类对其使用方式决定未来。
谷歌用Gemini 3同时革了OpenAI和英伟达两家的命
谷歌发布Gemini 3全家桶,打断英伟达和OpenAI双赢美梦。它实现原生多模态,对OpenAI构成代际优势;用TPU训练模型,摆脱CUDA依赖,冲击英伟达算力神坛。谷歌全栈自研,其发展或改变AI格局。
一周10来个模型被开源,阿里Qwen杀疯了~
阿里通义千问这周开源众多模型,如Qwen3 - Omni、Qwen - Image - Edit等,涉及全模态、图像编辑、安全审核等多领域。各模型能力出色,如Qwen3 - Omni能处理多模态输入,Qwen3 - VL表现超部分闭源模型。
大模型能复刻这些系统吗?ProgramBench给出了残酷答案
斯坦福NLP组发布ProgramBench,用200个完整代码库重建任务测试主流大模型,要求模型仅根据可执行文件还原如SQLite等项目完整代码,结果所有模型实际解决率为0%,说明模型更擅模仿代码表面结构。
500行极简开源框架,硬刚GPT/Gemini视觉极限!
多模态大模型代码能力进步大,但基础视觉任务常失误。UniPat AI构建SWE-Vision框架,让模型用代码处理视觉判断,在五个视觉基准测试达最优,其极简设计有效且泛化性强,代码已开源。
多稿合并:从手动比稿到一键 Skill
AI 翻译或写作常生成多版本稿件,各有亮点但不完美。手动合并耗力,可让 AI 完成。还能将流程做成 Claude 的 Skill,介绍了两种创建方式及适用场景,给出多稿合并 Skill 示例。
Anthropic重磅新研究:当AI采访了1250人,它看见了人类的「职业软肋」
Anthropic推出Interviewer工具,与1250名职场人、创作者、科学家深度对话,记录细节并量化。该工具能自动完成访谈、分析等流程,受访者满意度超97%。研究揭示不同职业对AI态度受职业结构等因素影响。
开源 VibeSDK:把一句话变成线上应用,用它一键搭好自己的 AI平台
Cloudflare VibeSDK 是开源 AI vibe coding 平台,跑在 Cloudflare 开发者生态上,支持自然语言生成全栈 Web 应用,有分阶段代码生成、交互式聊天等功能,适用于多类人群和场景,还对比了同类项目。