「传统软件测试」共找到 3164 篇相关文章
突发!Jason wei也被小扎挖走了
Jason wei是OpenAI研究科学家,是思维链、强化学习研究重要推动者,2023年2月加入OpenAI,此前在谷歌大脑工作。他和HYUNG Won Chung一同被小扎挖走,二人是o系列模型及测试时间计算重要推动者。
PDF难点解析:处理复杂表格、水印、印章、复选框、信息抽取等7项任务,6大能力
文章介绍Nanonets - OCR - s可处理关键信息提取、视觉问答等7项任务,具备LaTeX方程识别、图像描述等6项能力,还给出体验链接。但测试发现英文体验优于中文,模型有重复输出、幻觉严重问题。
退钱!Claude 4.8连夜大降智,GPT-5.6算力遭「腰斩」
最近AI社区遭遇集体降智潮,OpenAI疑似暗中开启GPT - 5.6灰度测试,克扣用户思考预算;Anthropic的Claude Opus 4.8被曝断崖式降智,性能不如旧版。或因SpaceX上市抽干流动性,巨头降本增效。
哈佛《Science》研究:大模型已碾压人类医生!
哈佛医学院等团队让OpenAI o1系列大模型与数百位医生在多项测试中较量,大模型在各项诊断和管理推理任务上全面超越人类专家,不过当下模型处理非文本信号有局限。
让AI Agent自动接Issue、写代码、上线:我用200行代码搭了一个全自动开发流水线
文章介绍AI Agent驱动的全自动开发流水线,对比传统流程,指出开发者角色转变。列举开源工具,给出200行代码的最小实现,分析半自动与全自动差异及信任鸿沟,点明开发自动化趋势,还给出落地建议。
如果你还在犹豫要不要尝试 OpenClaw,试试这个 App 一键部署方案
作者推荐 OpenClaw 这款开源产品,它像钢铁侠的 AI 助手贾维斯,可与通讯协同软件协作。还介绍用百度智能云 1 分钱部署 OpenClaw,阐述其配置、应用及价值,称 AI 会成基础设施。
告别RAG相似匹配!百度Agentic-R为多轮搜索重塑检索器
传统检索增强生成(RAG)有“单跳”局限,多跳推理易出错。人大高瓴与百度提出面向智能搜索的检索器训练框架 Agentic - R,采用双视角打分和双向飞轮模式,在多数据集上表现出色。
我国Chiplet产业的真实水位与全产业链突围
国内Chiplet市场快速增长,但与国际仍有差距。国家和地方给予政策与资金支持,多个联盟推动标准化。企业在设计、封测、EDA等领域积极布局,但面临核心技术、设计测试、产业链协作等挑战。
AI时代的设计:审美是唯一护城河!
文章指出AI时代设计门槛从会用软件转向有审美。介绍设计门槛转变原因、审美重要性,给出培养审美方法,推荐相关工具,为不会设计的人提供建议,强调审美是AI时代设计唯一护城河。
Qwen“半成品”推理模型刷下AIME满分,俘获大批国外开发者!实测碾压GPT-5 Thinking、还能写侦探小说
阿里发布 Qwen3-Max-Thinking 早期预览版,虽是‘半成品’,在数学推理竞赛中达 100% 正确率。Qwen3-Max-Preview 多项测试领先,速度超 ChatGPT,还成 AnyCoder 默认选项,但未开源。实测表现有优有劣。