「Agentic软件测试」共找到 4555 篇相关文章
n8n、扣子太难用了,Vibe Workflow 才是更大众的解
本文介绍 Refly.AI 推出的 Vibe Workflow,该产品获朱啸虎、高瓴投资且开源。它让普通人搭 Workflow,用 Agent 节点替代传统节点,降低门槛,还能迁移其他平台数据,核心是借模型提升发展。
OpenAI谷歌Anthropic罕见联手发研究!Ilya/Hinton/Bengio带头支持,共推CoT监测方案
OpenAI、谷歌DeepMind、Anthropic联合发表立场文件,提出CoT监测概念,认为是控制AI Agent核心方法。探讨其潜在机遇、局限,还提及不同公司对CoT监测的不同态度,如OpenAI乐观,Anthropic焦虑。
别跟LLM太交心!斯坦福新研究:AI不能完全取代人类心理治疗师
斯坦福大学研究团队测试流行AI模型及商业化AI治疗平台,发现AI治疗师存在根本缺陷与潜在危险,如歧视回应、无法危机干预、谄媚等,但也认可其在心理健康方面的辅助用途。
阿里「快乐小马」来了,首批网友已玩疯!720P低至0.44元/秒
今天,阿里HappyHorse - 1.0开启灰度测试。它有电影级叙事质感,指令遵循能力强,能驾驭多种风格,还可一句话改视频。性价比高,720P低至0.44元/秒,让AI视频从‘玩具’变‘工具’。
今天,Anthropic偷偷移除了Pro用户的Claude Code访问权
Anthropic一度将Claude Code从Pro套餐移除,引发开发者不满,数小时后官网回滚,负责人称是小范围测试。Claude Code因高消耗或调整收费,Anthropic正修正订阅模型,这或改变开发者工具格局。
Evaluation is All You Need:评估设计的微小差异如何扭曲结果
论文以DeepSeek - R1 - Distill系列模型为例,指出大模型评估中看似客观的基准测试结果对评估细节极度敏感,细微评估条件变化会致分数波动大,削弱模型对比可信度,呼吁建立新评估标准。
TabClaw:让 AI 真正读懂你的表格数据
TabClaw 是面向表格数据的 AI 分析 Agent,能让 AI 真正读懂表格数据。它核心标签是全透明与持续进化,工作流分显式和隐式两层,目标是成为真正理解用户、能一起成长的表格分析伙伴,项目已开源。
“大模型第一股”打响上市前哨战!智谱GLM-4.7 刷新开源编程SOTA,修复代码、终端操作表现超Claude 4.5
冲刺大模型第一股的智谱推出开源大模型GLM - 4.7,主打编程与代理式任务提升。它在多项基准测试中表现出色,UI质量飞跃,还采用新推理机制。智谱上市在即,但亏损扩张快,研发投入大。
谷歌Gemini-0605发布,全球大模型第一!
昨晚谷歌发布Gemini 0605版本,官方称其回归0325版本效果。该版本在多项基准测试中领先,Elo评分提升。谷歌针对反馈改进,使Gemini 2.5 Pro回答更优,还取消日期后缀,输入输出Token价格有优势。
所有Harness终将长成“龙虾”,但最后活下来的只有几只
在用户需求驱动下,工具从 LLM 向 Agent、Harness 再到 Claw 自然进化,但用户能容纳的 Claw 有限。Sam Bhagwat 拆解进化路径,指出各阶段核心竞争力,开发者应抢占用户心智空间。