测试时深思」共找到 2277 篇相关文章

新闻资讯7

AI编码工具变 “格式化神器”?Claude CLI半年频当“系统杀手”,多位开发者痛斥:心血都没了!

近日Reddit上一则对Claude CLI的控诉帖引发关注。一位开发者用其清理软件包,整个Mac系统被清空。类似情况并非个例,‘删库’成AI工具通病,开发者需强化安全操作意识。

InfoQ
新闻资讯8

Cloudflare 用 Rust 重写核心系统:CDN 性能提升 25%,响应间缩短 10 毫秒

Cloudflare 宣布用 Rust 重写核心子系统,响应间缩短 10 毫秒、性能提升 25%。基于代理框架 Oxy 构建 FL2,创建中间层让 Rust 模块在旧系统运行,还制定测试发布策略及回退机制。

InfoQ
开源动态8

训练200万小!OpenAI刚刚开源GPT-oss,AI Agent专属模型、可商用

今天凌晨OpenAI开源大模型GPT-oss,有1200亿和200亿两种参数,支持商用。它针对AI Agent训练,功能丰富。训练耗超200万小测试表现出色,架构设计也有亮点。

AIGC开放社区
开源动态7

MCP实战|从0到1构建异步 DeepResearch 工具,支持进度推送与超控制

本文借助开源项目,构建可在MCP Server中异步运行的DeepResearch,支持任务进度推送与超控制。介绍项目架构、构建步骤、任务管理器实现要点及效果测试,还提及优化方向并给出源码。

AI大模型应用实践
算法论文8

复旦提出自适应Reasoning方法ARM,“能屈能伸”

复旦提出自适应Reasoning方法ARM,解决LLM‘过思考’问题。ARM内置四种解题策略和三种决策模式,还搭配Ada - GRPO算法,在23个数据集测试中表现出色,省token、提速度且准确率高。

深度学习自然语言处理
开源动态8

龙虾冲浪终于不迷路了!网页智能体新框架Avenir-Web开源即SOTA

伦敦大学学院等团队推出开源框架Avenir - Web,解决现有Web Agent在复杂网页操作中的难题。它采用模块化设计,包含经验模仿规划等模块,在ONLINE - MIND2WEB测试中表现出色,已开源供开发者探索。

量子位
开源动态8

8.5K星 Agent 记忆准确率 94.6%,RAG那套被打穿了

AI Agent常没记忆,每次对话像白纸。Hindsight(vectorize-io/hindsight)有8500+ star,是仿生记忆系统,分三层记忆,检索系统TEMPR四路并发,在测试中成绩优异,且上手简单,能让Agent从经验学习。

CourseAI
新闻资讯8

刚刚Gemini上新模型,全球只有7人比它会编程,谷歌姚顺宇参与

北京间周五凌晨,谷歌发布Gemini 3 Deep Think重大升级,在多学术基准测试中取得佳绩,成本大幅降低,编程能力超多数人。在多科学领域表现出色,还推动了实际应用,已上线供部分用户使用。

机器之心
算法论文7

姚顺雨腾讯首篇论文:给AI下半场指路“上下文学习”

姚顺雨入职腾讯后首个成果CL - bench,用来测试大模型“从上下文中学习”能力。研究指出当下模型多依赖“过去”知识,无法适应“当下”学习。评测中,十个前沿模型表现不佳,揭示其真实场景应用缺陷。

量子位
开源动态8

蚂蚁开源 Ring-1T,成就推理、编程、通用智能三冠王

蚂蚁开源团队推出 Ring-1T 模型,它结合强化学习与多阶段推理机制,实现从‘模仿’到‘思考’的转变。该模型在多基准测试表现优异,其高性能得益于 IcePop、C3PO++、ASystem 三项关键技术。

AI科技评论