「两阶段流程」共找到 2011 篇相关文章
DeepSeek Harness规模化踩坑实录:耗时、成本、失败到底该怎么查
Agent 进入日常研发流程后,使用方关注耗时、Token 消耗和失败回溯。DeepSeek Harness(DSH)是开源 Agent 框架,腾讯云 Agent 可观测提供 DSH 采集插件,构成全景可观测方案,还介绍接入实践与其他能力。
实测飞猪 AI:真正的突围才刚刚开始?
2026年上半年,AI行业面临盈利难题,AI Coding虽火热,但旅游等领域落地AI更具挑战与潜力。飞猪升级AI能力推出「飞猪帮帮」,能办事、融合交互方式,还解决通用模型痛点,不过落地成闭环仍需供应商适配。
AI 3 秒给你一本书的摘要,我为什么还要花 10 小时读完
本文探讨AI时代读书投入产出比变化。指出很多书不必读完,印刷术与AI影响不同,AI降低加工成本,但认知成本省不掉。读书收益分信息和结构两部分,结构无法外包,选书能力也更重要。
真狠!4 万 Star CodeWhale,AI 写代码最怕的是什么????
文章介绍开源的CodeWhale,它是terminal coding agent harness,GitHub超4万Star。它给代码Agent定规则,涵盖身份、证据等原则。支持多模型,有任务流程和多Agent协作功能,还分析适用人群并给出启动方法。
邢波再出手:上次「骂」完世界模型,这次轮到智能体了
邢波教授新作《智能体模型批评》上线 arXiv,质疑当下被称为「智能体」的系统是否名副其实。论文将其分为两类,沿五维度拆解主流设计,提出 GIC 架构,还探讨了安全问题,指出要让能力内化进模型。
Anthropic总想摔碎程序员饭碗,甩出了“以后只招两种人”名单。
昨天Anthropic发布新产品Claude Tag,被Karpathy赞为LLM交互第三范式。Claude Tag与之前的Claude Code远程插件有4方面差别。产品负责人Fiona Fung分享,Anthropic人均代码交付量剧增,招人只看两类人。
小模型推理极限在哪里?微博开源3B小模型,比肩顶级闭源
微博新开源的VibeThinker - 3B小模型,将特定能力维度性能推向极限。它在数学竞赛、编程等可验证推理基准上表现优异,成绩直逼顶尖大模型。其训练流程层层叠加,还提出参数压缩 - 覆盖假说。
verify-data:一个端到端的数据验数 Agent Skill
本文介绍端到端数据验证 Agent Skill——verify-data,它能自动完成从表结构获取到报告发布全流程,将传统手工验数升级。文章从多方面展开介绍,还给出未来演进方向,为开发者提供参考。
Grok最新模型吃上Cursor「加餐」,马斯克:Coding实现巨大改进
马斯克在X上透露,xAI的Grok基础模型V9 - Medium(1.5T)完成训练,预计2 - 3周后发布,训练加入大量Cursor数据。同时,xAI的AI编程代理工具Grok Build进入早期Beta测试阶段。
“10周的工作量,AI只用4天!”Anthropic发布会全程实录:你引以为傲的复杂工程,在模型眼里只是个玩具
Anthropic举办‘Code w/ Claude’开发者大会,指出AI模型能力呈‘指数级’增长,多数企业开发模式却停留在‘线性’阶段。大会祭出三大杀手锏,包括更强底层模型、Claude Platform代理编排能力和Claude Code桌面端。