测试任务」共找到 3358 篇相关文章

开源动态7

从browser-use 出发,品 Agent 实现

本文作者以学习总结视角,从browser - use出发解析Agent实现。介绍LLM不同阶段,阐述Agent记忆、规划、工具等要素,通过对话演示和源码分析展示运行机制,还探讨MCP集成和Coze space应用模式。

阿里云开发者
新闻资讯7

奥特曼:假如给我一千倍算力,我会这样做

奥特曼在最新访谈展望下一代模型,认为完美AI是有超人推理能力等的微型模型。理想AGI能自主发现新科学,使全球科学发现提速。他还回应算力假设,为企业指明投入资源方向。

量子位
产品应用7

心得分享:凭借 Cursor,数周内完成产品上线月收入过万!

网友用Cursor数周开发垃圾邮件清理工具获利,月收入近1500美元。他分享七条使用心得,如提示“自顶向下”、测试先行等,还建议关注交付效率和质量,持续迭代。

AI工程化
算法论文8

首次解释LLM如何推理反思!西北大学谷歌新框架:引入贝叶斯自适应强化学习,数学推理全面提升

西北大学与Google、谷歌DeepMind团队质疑传统强化学习与反思的关系,提出贝叶斯自适应强化学习方法,首次解释为何、如何及何时反思探索新策略,还给出决策数学形式,实验显示其性能更优。

量子位
开源动态7

字节开源了一个了不得的模型!

字节跳动开源统一多模态基础模型BAGEL,一个模型能同时理解和生成文本、图像、视频。部署测试有亮点但效果不稳定,还分享该模型体验Demo、地址及安装使用教程。

探索AGI
推荐文章8

两年内打造AI软件工程师!OpenAI Codex 作者解密人机结对编程新模式

AI科技大本营编译访谈,OpenAI的Josh Ma与Alexander Embiricos分享Codex项目,包括缘起、人与AI结对编程范式,还探讨产品形态、最佳实践等,预测两年内打造智能体软件工程师。

AI科技大本营
新闻资讯7

最新!OpenAI:GPT-5将实现大统一,Codex最佳实践是这样的

OpenAI Codex在Reddit AMA活动中,核心负责人围绕先推云端代理、GPT - 5与Operator整合等问题给出路线图。如Codex - 1预览情况、CLI设计、使用场景、安全模型、接入计费及API生态等方面都有说明。

AI寒武纪
算法论文7

DeepMind 提出 CaMeL,抵御 LLM 提示词注入

谷歌DeepMind研究人员提出CaMeL,作为围绕LLM的防御层,通过提取查询中的控制流和数据流阻止恶意输入,能在AgentDojo基准测试中抵御67%攻击,采用传统软件安全原则。

InfoQ
算法论文8

RL训练总崩溃?R1-Reward稳定解锁奖励模型Long-Cot推理能力

多模态奖励模型对提升多模态大语言模型表现至关重要,但强化学习在奖励建模应用有挑战。快手等团队提出R1 - Reward,解决训练不稳定等问题,在基准上超SOTA模型,还在快手业务场景成功应用。

机器之心
新闻资讯9

从Chat、Code到Discovery,AI开始学着做科学家

本文报道AI发展进入全新阶段,任务从聊天、写代码拓展到自主科学发现,介绍PhAI Labs推出的DFM系统,分享架构设计与落地案例,分析行业痛点与解决路径。

机器之心