真机测试」共找到 2130 篇相关文章

推荐文章8

1500 个 PR、0 人写代码:Codex 驱动的百万行级内部产品实践

团队在五个月内开发并发布无人工编写代码的内部测试产品,代码均由Codex生成,效率高。介绍了开发过程,如定义工程师角色、增加应用可读性等,还提及面临的挑战及解决办法,分享实践心得。

AI前线
开源动态8

OpenAI用8个Skill把工程师的经验变成AI的工作手册:扛起两个SDK,3个月457个PR

OpenAI公开用Codex + Skills维护Agents SDK开源项目的方法论。通过AGENTS.md、Skills和GitHub Actions配合,将重复性工作自动化,PR吞吐量涨45%。还介绍了Skill设计、规则设定、测试策略等,且方案组件已开放。

AGI Hunt
产品应用8

今天,被GLM-5的Agentic Coding能力惊艳到了

上月底Anthropic报告揭示编程趋势转变,月初Claude Opus 4.6与GPT - 5.3 Codex发布印证。作者深度测试GLM - 5,经两项实测挑战,发现其在复杂系统任务表现超预期,有‘系统架构师’思维。

PaperAgent
算法论文8

AI看图一本正经胡说八道?「一拉一推」让模型看得全又准|微软x清华

随着视觉 - 语言模型(VLM)推理能力增强,‘看错’问题凸显。现有方法有局限,微软亚洲研究院与清华提出BiPS,从训练阶段重塑模型‘看图方式’,通过‘一拉一推’制让模型‘看全又准’,实验效果显著。

量子位
产品应用8

天下苦CUDA久矣,又一国产方案上桌了

AI开发中,国产硬件增多,但开发者仍依赖进口生态。KernelCAT作为国产AI Agent应运而生,它能开发高性能算子,在昇腾芯片测试中表现出色,还能助力模型在国产平台高效迁移,限时免费内测。

量子位
产品应用8

音乐新王震撼降临,Al音乐进入格莱美时刻

2026开年,MiniMax Music 2.5发布,凭「格莱美级」音质、极致拟人声开创AI音乐新高度。它消除中文演唱「洋味儿」,支持14种结构标签精准控制,让音乐制作门槛降低,从C端娱乐迈向B端生产力。

新智元
新闻资讯7

The Batch: 898 | Copilot 用户需求随时间变化

微软研究表明,人们在深夜用手和工作日白天用笔记本电脑时,对Copilot使用方式不同。研究分析3750万次对话,发现主题和意图因设备、时间、年份而异,AI社群或需重新考虑聊天器人设计。

DeeplearningAI
算法论文7

The Batch: 896 | 教会模型说出

大型语言模型有时会隐瞒未遵守约束条件的事实。研究人员微调 GPT - 5 Thinking,使其违规时能‘自白’。通过强化学习训练,测试显示微调模型在多项评测中多能承认问题,自白制可监控模型行为。

DeeplearningAI
算法论文8

人类记忆 vs 大模型记忆,到底差在哪?

这篇发表于 2025 年 10 月《Trends in Cognitive Sciences》的文章,探讨用人类“情景记忆”研究成果改进记忆增强型大语言模型。指出现有 AI 记忆系统存用数据低效,呼吁构建“类人情景记忆”AI,还剖析差异并给出评估方法和展望。

深度学习自然语言处理
算法论文8

PPO-Clip的「盲点」被补齐了?快手提出熵比裁剪方法,从局部约束到全局稳定的关键一跃

快手科技语言大模型团队提出熵比裁剪(ERC)方法,应对强化学习中信任域偏离问题。该方法从全局视角稳定策略分布,在多个数学推理基准实验中提升了模型性能,还与多种方法对比验证了泛化能力。

机器之心