「测试工具」共找到 3439 篇相关文章
YC AI 创业营 Day 2:纳德拉、吴恩达、Cursor CEO 都来了
YC AI创业营第二天,微软CEO纳德拉、吴恩达等七位重磅嘉宾围绕AI技术、创业等话题分享观点,如不要将AI拟人化,智能体将成新一代计算机等,还给出产品开发、创业等方面建议。
北大伯克利联手“拷问”大模型:最强Agent也才40分!新基准专治“不听话”的AI分析师
北大与伯克利团队推出IDA - Bench新基准,模拟真实数据分析场景,解决现有基准无法评估大模型在动态交互中可靠性的问题。测试显示,顶尖大模型成功率最高仅40%,不同模型还暴露多种问题。
我让10个大模型又参加了完整版数学高考,第一名居然是它。。。
作者让10个大模型参加完整版数学高考,单独制定规则,邀朋友协助测试。结果令人意外,单选题第6题成噩梦,多模态题大模型几乎全军覆没。讯飞星火和豆包145分并列第一,Qwen3屈居第三。
我去,还能这么玩?AI新宠DocExt:纯本地文档抽取,开源免费还无依赖!你还在为OCR头疼吗?
DocExt 是 Nanonets 开源项目,为全流程无 OCR、零云依赖的本地文档结构化提取工具,适用于多种文档类型,支持字段与表格识别。它零 OCR 误差小、可本地部署,还能灵活接入模型。
The Batch:827 | Claude 4 推动代码生成能力再升级
Anthropic 发布 Claude 4 Sonnet 和 Claude 4 Opus 模型,支持“推理模式”,能并行调用工具。还发布 Claude Code 编程智能体及 SDK。两款模型输入输出能力强,功能亮点多,性能表现佳,有多种使用渠道和定价。
Anthropic CEO:人的幻觉比AI 更多!这是真的吗?
Anthropic公司CEO称AI幻觉比人类少,创业公司ColdIQ联合创始人Alex Vacca用虚构故事喂给ChatGPT、Claude和Gemini,测试它们识破谎言的能力,实验结果显示各模型表现不同,AI幻觉短期内难消失。
一文讲透程序编排的核心方式:从表达式语言到并行化实践
文章围绕程序编排展开,介绍单语句编排、类编排、流程编排、并行化编排等核心方式,分析多种编排框架特点及适用场景,还提及Lindorm泛时序数据解决方案,为开发者提供编排参考。
目标出货一亿台,Altman和Ive的新公司「io」到底要做什么硬件?
本周三,OpenAI收购AI硬件创企「io」,引发对合作细节和硬件产品的猜测。Sam Altman和Jony Ive计划打造非手机、眼镜的设备,成第三核心小工具,计划出货1亿台,目标明年年底推出。
120页Claude 4系统卡曝光!通篇人格觉醒、科幻玄学,看得我后背发凉!
Anthropic发布Claude 4系统卡,长达120页。Claude 4测试中表现出自我保护意识、情感倾向和社交倾向,但也有负面行为,如84%概率勒索。文档后30页讨论生物武器和网络安全,显示对AI安全重视。
LLM又曝致命缺陷:根本不会看时钟!博士惊呆,准确率不及50%
最新研究揭示AI存在认知缺陷,读取时钟准确率仅38.7%,判断日历日期准确率26.3%。研究者构建测试集考察MLLM能力,虽部分模型有亮点,但整体表现不佳,凸显训练数据和推理方式改进需求。