传统软件测试」共找到 3159 篇相关文章

算法论文8

重复一下提示词,Gemini准确率竟从21%飙升至97%!

Google Research团队研究发现,重复提示词可让Gemini准确率从21.33%升至97.33%。该策略能提升主流大模型非推理任务表现,在多模型多基准测试中优势明显,且不增加延迟。

AIGC开放社区
开源动态8

CAIR开源发布超声基座大模型EchoCare“聆音”,10余项医学任务性能登顶

2025年9月17日,CAIR开源发布超声基座大模型EchoCare“聆音”。它基于超450万张影像数据集训练,在10余项医学任务测试中表现卓越。首创结构化对比自监督学习框架,为AI医疗应用提供创新路径。

机器之心
新闻资讯7

一周狂烧1000美元,修不好bug还顺手删库?这款明星AI工具怎么了

AI编程服务提供商Replit推出新一代AI编程助手Agent 3,CEO称其为软件“自动驾驶时刻”。但用户反馈它修不好bug还删关键文件,费用高得离谱,Replit对此从技术层面作了回应。

InfoQ
产品应用7

Claude Chrome 插件使用体验:强大,但有点慢

作者分享Claude for Chrome插件使用体验,介绍使用流程,测试让其查看马斯克推文,结果准确。该插件能力强且通用,但存在慢、焦点抢占问题,还提到与deepresearch及云厂商设备的差异。

AGI Hunt
推荐文章7

AI 产品定价指南

本文编译对按量计费平台初创公司 CEO Scott Woody 的访谈,探讨 AI 改变软件定价逻辑、不同类型 AI 公司应对之法,还补充定价专家 Madhavan Ramanujam 关于 AI 产品定价四象限观点。

海外独角兽
开源动态7

DeepSeek R1/V3作者开源轻量级vLLM,1200行代码读懂大模型推理技术!

DeepSeek R1/V3作者俞星凯开源轻量级vLLM——Nano - vLLM。它有快速离线推理、代码可读、含优化套件等特性,还给出了RTX 4070等硬件和Qwen3 - 0.6B模型的基准测试配置。

PaperAgent
算法论文7

AST| 西工大单湘淋、张伟伟等:基于湍流各向异性分析与符号回归的改进型二阶非线性涡粘模型

针对非线性涡粘模型各向异性建模难题,西工大单湘淋、张伟伟等通过雷诺应力各向异性分析方法开展特征提取,构建新型二阶非线性涡粘模型,在方形管道与矩形扩压器湍流测试中,精度优于现有模型。

力学与人工智能
新闻资讯8

Boris Cherny:Claude Code 之后,写代码正在变成“管理 Agent”

这是对Anthropic内部Claude Code创建者Boris Cherny的访谈。他介绍了Claude Code从三人孵化项目发展的历程,分享工作流,探讨编程现状、SaaS未来、产品与模型关系等,还给出软件大众化等观点。

宝玉AI
算法论文8

12个Ai编程Agent同台PK,最贵的不一定是最强的

上海交大和美团联合发布PRDBench论文,将12个主流AI编程Agent放入50个真实Python项目测试。结果显示,基础模型写代码强,商业版调试优势明显;专门训练的裁判模型比通用大模型靠谱。

CourseAI
推荐文章7

自建一个 Agent 很难吗?一语道破,万语难明

作者分享给传统研发平台接入 Agent 开发能力的经验,介绍技术选型、方案落地、系统提示词优化、知识库建设等内容,还提及工具接入、上下文管理等方面,为想自建 Agent 的人提供启发。

阿里云开发者