前端自动化测试」共找到 2240 篇相关文章

开源动态8

DeepSeek-OCR是「长文本理解」未来方向吗?中科院新基准给出答案

DeepSeek-OCR的视觉文本压缩技术降低长文本处理成本,中科院自动化所等团队推出VTCBench基准测试评估模型视觉认知,含三大任务及衍生版本,测试结果有‘U型曲线’,还评测多种尖端模型。

新智元
开源动态8

OpenAI深夜开源HealthBench,60个国家合力开发5000段真实对话

今天凌晨1点30,OpenAI开源医疗大模型测试评估集HealthBench。其5000段核心测试对话由60个国家/地区的262名医生打造,采用多轮对话测试测试显示大模型在医疗保健领域表现显著提升,还介绍了其构建及评估等情况。

AIGC开放社区
推荐文章7

烧了1万块横测,你用的模型可能掉队了

作者花大成本从后端、人味、前端、推理等维度,对glm 5.2、kimi k3等国产模型进行测试,展示各模型在不同测试中的结果,指出国模2T俱乐部的kimi和qwen下限高,且刻板印象需改变。

探索AGI
开源动态8

24K+ star!AI 专用无头浏览器,快11倍、内存省9倍!

Lightpanda是专为AI代理、网页抓取和自动化测试而生的开源无头浏览器,用Zig语言重写核心引擎。官方称其速度比Chrome快11倍,内存占用仅为1/9,兼容主流自动化库,目前处于Beta阶段,已获24k+ Star。

开源先锋
新闻资讯7

Show me《指环王》!卡帕西强推大模型评测新基准

大神卡帕西宣称Anthropic用《指环王》给大模型评测上强度,这一‘指环王基准’正接替‘鹈鹕骑自行车’SVG测试。虽Opus 5生成的画面粗糙,但网友测试展现出丰富创意,不过新测试也引发争议。

量子位
新闻资讯8

谷歌Gemini 3杀疯了!陶哲轩亲测:10分钟干翻百年数学难题

Gemini 3本周一发布后开启横扫基准测试之旅。在FrontierMath基准测试创纪录,Epoch能力指数超GPT - 5.1。陶哲轩用Gemini Deepthink十分钟解决埃尔德什问题关键证明,同时它还霸榜物理基准测试CritPt。

新智元
新闻资讯7

刚刚,ARC-AGI-3发布!人类100分,最强AI零分

ARC Prize发布ARC - AGI - 3预览版,测试范式从静态谜题到交互式游戏。新引入交互式推理基准测试,人类轻松通关,最强AI却全军覆没。但测试引发社区质疑,奖金设置也遭吐槽,且存在体验和技术问题。

AGI Hunt
新闻资讯7

企业广泛采用 Agentic AI,但领导层理解滞后

Sauce Labs调查显示,97%公司采用或计划采用Agentic AI用于测试,但61%领导层不完全了解软件测试需求。调查揭示矛盾现象,如受访者既看好自主测试又对数据访问不安。还指出团队与高管期望有差异,需解决不一致。

InfoQ
产品应用7

新DeepSeek R1代码能力直逼Claude 4!附生成任何优质网站的通用提示词

作者体验DeepSeek R1超8小时,发现其文本写作问题大幅修复,思维链推理改进,代码能力提升,前端审美直逼Claude 4。文章展示其前端能力,给出写前端网页提示词及设计逻辑,还探讨了其在复杂任务中的表现。

花叔
算法论文8

算法1年翻倍,芯片2年翻倍?重磅实锤:AI正在自我加速,拦不住了

NBER论文证明AI研发自我加速反馈环强度远超其他科技领域,芯片效率每2年、算法效率每1年翻倍。部分自动化就能引爆反馈环,全行业13%自动化率或软硬件17%自动化率可触发奇点,6年内AI可能实现自我迭代。

新智元