「API 测试」共找到 2103 篇相关文章
ACL 2026 Main | 不只是调用地图API,Spatial-Agent让大模型生成可执行地理分析工作流
大语言模型在空间领域应用广泛,复杂地理分析问题需组织自然语言成可执行流程。Spatial - Agent 加入 GeoFlow Graph 中间层,借用 GIScience 理论,实验显示能提升准确率,不过仍受数据质量等限制。
Thinking Machines首款产品重大更新:K2 Thinking、Qwen3-VL都可以微调了
由前OpenAI CTO创办的Thinking Machines Lab推出的首款产品Tinker API有重大更新。取消候选名单面向所有用户,还可微调Kimi K2 Thinking,新增兼容OpenAI API接口,支持Qwen3 - VL视觉输入,降低模型训练门槛。
扩展外部测试时Scaling Law,中关村学院新发现:轻量级验证器可解锁LLM推理最优选择
文章聚焦大语言模型‘测试时扩展’,指出内部方法接近瓶颈,外部方法的传统实现有缺陷。提出 TrajSelector 策略,用轻量级打分模型复用隐状态打分,训练无需手动标注,实验显示性能增长稳定。
GPT正面对决Claude!OpenAI竟没全赢,AI安全「极限大测」真相曝光
OpenAI和Anthropic罕见合作,测试双方模型在幻觉等四大安全方面的表现。这场合作是AI安全的里程碑,百万用户每天的互动推动安全边界扩展。文中详细对比了GPT和Claude模型在各安全测试中的表现。
前Meta大神创业,用强化学习打造PokeeResearch-7B模型,刷新AI深度研究SOTA
Pokee AI发论文介绍70亿参数的PokeeResearch - 7B模型,用基于AI反馈的强化学习和推理框架,在深度研究基准测试中成绩领先。该公司由前Meta大神创立,产品可打通多应用,已获融资并公开测试。
《动手写AI Agent》多模型适配:一套代码跑通三家 LLM
上一章用火山引擎豆包 API 写了能跑的 Agent,但换模型重写代码会混乱。本章用 Adapter 模式解决问题,介绍火山引擎、Claude、OpenAI 三家 API 关键差异,还分析了 Claude 工具调用格式特殊之处。
GPT-5基准测试泄露,被曝两天后发布?打Minecraft震撼开挂网友直呼封神
GPT - 5消息不断,泄露的基准测试及Minecraft实测惊艳网友。有爆料称7月31日发布,也有消息指8月。它或统一o与GPT系列,编码能力强,能处理复杂编程任务,不过也引发对其影响的担忧。
GPT-5.2发布即降智?背后华人被挖出,清北校友核心贡献
OpenAI发布GPT - 5.2,官方称其基准测试碾压Gemini 3 Pro,擅长完成有经济价值任务。但发布后实测有翻车情况,也有提前测试者称其很强。此外,背后多位核心贡献者为华人,如北大校友Yu Bai等。
分享2个模型省钱大法
文章分享两个大模型API省钱技巧。一是文本转截图,适用于输入长输出短、费用花在输入token的任务;二是音频加速识别,OpenAI语音识别模型Whisper按音频时长收费,加速音频可省钱,还可包装成API服务盈利。
MiniCPM-o 4.5 技术报告发布:全双工全模态 API 开放,RTX5070即可实时运行
面壁智能联合多机构发布 MiniCPM-o 4.5 技术报告,公开 Omni-Flow 框架。该模型 9B 参数实现端到端全双工全模态,开放在线 Demo、API 等,最低 12GB 显存 GPU 可运行,在多维度评测表现出色。