「Agentic软件测试」共找到 4554 篇相关文章
你还在关注大模型排名?这家公司已在全球收割AI红利,做“真正能交付结果的”Super Agents
文章借昆仑万维财报,探讨AI商业化进程。该公司战略重视AIGC,有全面业务场景。其发布的天工超级智能体解决行业痛点,上线APP拓展办公场景。财报显示营收增长,AI业务成引擎,为行业提供借鉴。
EMNLP25 | 北大x腾讯光子发布 C3 Benchmark:中英双语语音对话模型“地狱级”测试基准,直击语音对话模型软肋!
近年来语音对话模型受关注,但处理人类对话复杂现象的效能缺乏研究。北大联合腾讯光子构建中英双语C3 Benchmark数据集,评估模型应对复杂对话的能力,结果揭示性能瓶颈,为模型优化提供参考,代码和数据已开源。
Borg调度进化了!谷歌超强AI Agent 登场:能设计算法、提效系统,陶哲轩亲自助攻,网友封神理科扛把子!
谷歌 DeepMind 推出由 Gemini 驱动的 AI 智能体 AlphaEvolve,能设计算法、提效系统,破多项数学记录。它已用于谷歌多领域,还将探索材料、药物研发等领域,也计划推早期访问计划。
AI 已能写 80% 代码,但 Agent 也有致命短板!OpenAI Codex 技术总监:问错了,比不会写更麻烦
OpenAI Codex 技术负责人 Michael Bolin 在访谈中回顾职业轨迹,分享从工程师到工具创造者的成长经历。他认为 AI 编程时代 80%-90% 代码可由模型生成,但关键部分需人类把控,提出正确问题能力更重要,编程智能体执行将更多迁移到云端。
4小时喜提专属 ChatGPT、卡帕西又整活!自曝Agent帮倒忙、手搓八千行代码,网友:跑完就当上机器学习工程师
特斯拉前AI总监安德烈·卡帕西发布开源项目nanochat,是极简全流程训练/推理工具链,可搭建简易版ChatGPT复现模型。花100美元最快4小时能训练出可对话模型,代码基本手写,网友热度高。
我把Claude变成了带记忆的人生教练,结果它比我还了解我自己|人生教练 Agent v2.1
作者将Claude打造成带记忆的人生教练,记忆功能让教练能回顾过往对话。其技术栈不复杂,相比传统教练优势明显。虽有缺乏情感共鸣等局限,但能发现认知盲区,未来有改进空间。
“连我也要被GPT-5踹了!”Altman再发暴论:写款软件就花7毛钱,大批高级程序员岗也说没就没
OpenAI 首席执行官 Sam Altman 在播客和会议上谈 GPT - 5,称其“几乎所有方面比人类聪明”,还预言 AI 对就业、医疗等领域影响大,也指出 AI 有欺诈等风险,强调其发展不确定性。
“连我也要被GPT-5踹了!”Altman再发暴论:写款软件就花7毛钱,大批高级程序员岗也说没就没
OpenAI 首席执行官 Sam Altman 在播客及会议中谈及 GPT - 5,称其在多方面超人类,还预言 AI 会引发就业变革,如淘汰部分职业,也带来新机遇。同时指出 AI 虽益处大但风险高,如欺诈危机。
Qwen 3-235B Aider编程能力击败Claude3.7,成本便宜百倍
Qwen3-235B-A22B在Aider多语言编码基准初步测试中击败Sonnet 3.7 Thinking和OpenAI o1,成本便宜150到600倍。Qwen3-32B准确率超GPT-4.5和GPT-4o ,代码编辑格式正确率达100%。
“你的Agent,我一周末就能做出来!” AI时代的护城河:Cursor 卷每日迭代速度,DeepSeek 用技术撕大厂规模优势
文章围绕AI时代创业的“护城河”展开,介绍YC播客讨论内容,指出因ChatGPT易复制,创业者需思考持久商业模式。还列举Cursor、DeepSeek等案例,阐述速度、流程之力等多种构建护城河的方式。