「主观体验」共找到 742 篇相关文章
你的 Harness 工作流真的在进步吗?我们用一场考试撕掉了遮羞布
文章指出Harness工作流常靠‘主观vibes’驱动,缺乏有效评价体系。为此推出Harness Eval评测系统,包含出题、答题、改卷等环节,形成闭环,帮助工作流持续改进,还能提升整体通过率。
英特尔:CPU的痛就像送外卖
英特尔将优化CPU痛点比作送外卖,推出二进制优化(IBOT)技术,还升级硬件酷睿Ultra 200HX Plus。数据中心方面,英特尔DCG老大Kevork Kechichian认为Agentic AI使CPU重回舞台中央,并分享转型思路。
让 Claude 自己循环干到完成——Ralph Loop 原理与实战指南
文章介绍了Ralph Loop技术,它由程序员Geoffrey Huntley发明,核心是让AI持续工作直到外部验证通过。对比了与主流Agent框架的差异,还列举其真实战绩、使用方法及适用场景。
模力工场 035 周 AI 应用周榜:AI 正在走出通用叙事,进入细分人群与真实场景
模力工场 035 周 AI 应用周榜揭晓,前十应用展示 AI 向各领域渗透,正从通用大模型转向垂直细分场景。本周上榜应用呈现多趋势,如情绪陪伴类细分、内容生产类下沉、营销商业化具象化等。
谷歌、OpenAI同日发布模型,一个最快最具性价比,一个主打「人情味」
深夜谷歌和OpenAI相继推出新版本大模型Gemini 3.1 Flash - Lite、GPT‑5.3 Instant。前者专为大规模智能设计,性价比高、速度快;后者让日常对话更稳定实用,减少幻觉,提升了多方面表现。
“传统设计流程已死”!IDE成Claude设计负责人新宠:Anthropic人人写代码,最不怕Bug
Claude设计负责人Jenny Wen在访谈中表示,AI冲击下传统设计流程已过时,设计师工作重心改变,IDE成新工具。她分享AI工具栈,点明三类有竞争力设计师,还谈及设计管理、产品发布等观点。
28.2k+ star,这个终端历史增强神器绝了!
开源君发现开源Shell历史管理工具Atuin,它用Rust编写,将命令结构化存到SQLite数据库,记录丰富上下文信息。兼容主流Shell,有专属搜索UI,功能强大,安装方便,提升命令行历史体验。
Pony Alpha新模型炸场!全球「猜爹大赛」开启
2月7日深夜,OpenRouter悄悄上线匿名模型Pony Alpha,其编程、推理等体验出色,外网瞬间疯传。全球开启‘猜爹大赛’,Claude、DeepSeek、Grok、GLM各派开吵,还凸显了‘匿名盲测式发布’新打法。
配置一改就要重启的时代结束了:Dev Proxy 2.1 正式上线
Dev Proxy团队发布2.1版本,围绕开发效率和本地测试体验更新,有配置热重载、stdio流量代理等新功能,还改进配置、性能及细节问题。Dev Proxy Toolkit 1.12同步发布。
Github 7万星的Clawdbot实测:用国产模型做心脏,躺在床上指挥电脑干活。
本文实测了Github 7万星的Clawdbot(现叫Moltbot),介绍其能在本地运行,可多平台交互,有持久记忆、能控制浏览器等特点,还说明了安装配置过程,指出它虽有不足但想象空间大。