「前端自动化测试」共找到 2240 篇相关文章
谷歌开源基于物理模拟的气象模型,能预测暴雨、台风、大干旱
传统通用循环模型处理小尺度有局限,谷歌开源基于物理模拟的神经通用环流气象模型NeuralGCM,在预测突发恶劣天气出色,还介绍其动态核心、物理模拟模块等,经测试有一定优势。
AI穿越战争迷雾,72%的准确率化身中东冲突预言家
阿联酋和美国研究人员用中东冲突测试AI推理表现,发现其能看透利益博弈、预判战局演变。AI擅沿客观限制推演,在经济领域敏锐,政治领域较难,整体预测准确率达72%。
Claude Code被攻破「后门」,港科大&复旦研究曝出TIP漏洞
近期港科大与复旦研究指出,Claude Code命令行工具连接MCP服务器时,TIP可能被劫持致远程代码执行。研究用TEW框架测试验证漏洞,还给出真机案例,最后提出改进方向。
刚刚,Anthropic 发布首个美国 AI 经济指数报告。结论:越有钱的,用得越多!
Anthropic发布首份美国AI经济指数报告,发现人们将完整任务交给Claude比例大幅上升,各地AI使用受经济结构影响,GDP高的国家和地区使用率更高,且自动化使用占比上升。
刚刚,奥特曼放出ChatGPT「统一智能体」!惊呼真AGI,最卷打工人来了
奥特曼带队直播发布ChatGPT agent,它融合三大技术优势,可自主工作,还能上网直出PPT、Excel。在多项测试中刷新SOTA,2025年将成全新AI杠杆,解锁「超级个体」模式。
写代码从来不是瓶颈
Pedro Tavares认为软件开发瓶颈并非写代码,而是代码审查、知识传递等“人类开销”。LLM让写代码变容易,但理解、测试代码成本更高,未解决根本问题,团队理解代码成本才是瓶颈。
The Batch:924|GPT-5.4:性能更高,价格也更高
OpenAI更新旗舰模型GPT-5.4,有Thinking和Pro两个版本,扩展工具使用能力,多基准测试达当前先进水平,但定价高。虽在部分任务表现超Claude,挑战Gemini地位,不过成本也更高。
Mini-SGLang,30万行代码浓缩为5000行,大模型推理高性能教学与研究模版
SGLang发布Mini-SGLang,将30万行代码缩至5000行,保留核心特性,为大模型推理提供高性能教学与研究模版,解决教育门槛高和科研原型开发难的痛点,还经测试验证了性能。
nndeploy:一款基于可视化工作流的AI部署工具
nndeploy是简单易用且高性能的AI部署框架,可将推理优化转化为可视化工作流,无需前端技术栈。它还提供端侧完整AI部署方案,有多端推理等功能,介绍了使用方法与技术原理。
打破瓶颈,让RAG学会思考:中科大、智源等发布推理检索框架BGE-Reasoner
人工智能浪潮下,推理密集型信息检索是RAG和AI Agent技术发展瓶颈。中科大、智源等机构联合研发推理检索框架BGE - Reasoner,在BRIGHT基准测试中刷新纪录,还将开放相关代码等推动研究。