「测试工具」共找到 3407 篇相关文章
GPT-5超越人类医生!推理能力比专家高出24%,理解力强29%
最新研究显示,GPT - 5在医疗领域处理多模态信息能力出色,在多模态测试中推理和理解得分比GPT - 4o分别提高近30%和36%,比人类医生还高。其能力提升源于端到端多模态架构,但现实应用还需更多实战考验。
mcp-feedback-enhanced:一个让 Cursor 500 次额度膨胀N 倍的骚气 MCP!一次请求变成 N 次!
Cursor每月500次请求额度常不够用,网友分享“咒语”利用其工具调用功能让一次请求变多次。mcp-feedback-enhanced这个MCP工具能将多次交互合并到一次请求,还介绍了使用、安装配置及持续调用优化方法。
大模型Agent的核心还是prompt? 目前有什么挑战?
文章指出大模型Agent核心并非Prompt,而是工程化架构设计、工作流编排与数据闭环。介绍Flow Engineering等概念及工具,分析规划、记忆、工具使用要点,还谈及开发面临的延迟、稳定等挑战,并给出应对建议。
震荡股市中的AI交易员:DeepSeek从从容容游刃有余? 港大开源一周8k星标走红
2025年10月美股震荡,港大黄超教授团队开源AI-Trader项目启动实盘测试,上线一周在GitHub获近8K星标。6位AI交易员投入纳斯达克100交易,实验测试其交易纪律、市场耐心和信息过滤能力。
ICML 2025 Spotlight | 多模态大模型暴露短板?EMMA基准深度揭秘多模态推理能力
最新研究推出 EMMA 基准测试,揭示顶尖多模态大语言模型在深度视觉与文本融合的复杂多模态推理上显著不足。该研究已被 ICML 2025 接收,代码数据开源。实验表明,现有模型与人类专家差距大,视觉推理是核心瓶颈。
Vibe Coding 有了,Vibe Design 呢?Lovart 让不会设计的人也能输出专业素材
作者用 AI 编程一年多,但标签页表情包提醒自己不是设计师。现有生图工具生成的 PNG 不能直接当 logo 用,而 Lovart 打通从 PNG 到 SVG 的路,让无设计知识的人也能输出专业素材。
The Batch: 864 | GLM-4.5:一款开放的智能体竞争者
大型语言模型推动智能体能力交互竞赛正酣,中国 Z.ai 推出 GLM - 4.5 系列开源权重模型,在推理、编程等基准测试中表现出色,还介绍了其工作原理、研究和测试结果等。
Builder.ai 破产背后:700 名工程师伪造 AI 是假,重复造轮子及财务造假是真
印度AI独角兽Builder.ai破产引发关注,此前有说法称其用700名工程师伪造AI。经与前员工沟通,这一说法不实。该公司搭建了AI工具Natasha,技术栈含Python、GPT等,但存在重复造轮子、财务欺诈等问题致破产。
苹果憋一年终超同参数 Qwen 2.5?三行代码即可接入 Apple Intelligence,自曝如何做推理
今年 WWDC 大会上,苹果推出专为增强 Apple Intelligence 功能的语言基座模型,含约 3B 参数紧凑型与基于服务器的混合专家模型。经优化可在苹果芯片高效运行,改进工具使用与推理能力,评测显示设备端模型表现优。
一年吃掉一块固态硬盘,Codex日志bug被骂「劣质软件」
OpenAI旗舰编程工具Codex因日志Bug,一年写入量达640TB,耗尽硬盘寿命。该问题4月就有反馈,拖两月才处理,仅减少约85%写入。Codex类似问题至少9个,AI编程工具质量引质疑。