「Agentic软件测试」共找到 4562 篇相关文章
OpenAI首款芯片问世:用AI设计,9个月流片
本周三,OpenAI 与博通合作推出首款芯片 Jalapeño,用于人工智能推理负载,由博通制造。它用 AI 设计,9 个月流片,性能未公布但早期测试显示每瓦性能优,目标 2026 年底前初步部署。
Kimi推出超实用插件!让AI真正像你一样操作浏览器
月之暗面推出Kimi WebBridge浏览器扩展插件,让AI Agent像用户一样操作浏览器。它采用本地优先路线,保障安全,可实现信息采集等自动化操作,还能创建CLI工具,是AI浏览器自动化趋势的重要成果。
复旦北大联合美团LongCat提出TDAR:用“粗思考,细求证”破解Block Diffusion的速度精度悖论
复旦大学、北京大学联合美团LongCat提出Block Diffusion推理模型Test-Time Scaling新框架TDAR,引入‘粗思考,细求证’范式与有界自适应置信度解码,打破速度与精度零和博弈,在多基准测试表现出色。
moltbook爆火背后:人类操控?伪造截图?Karpathy发风险提醒
moltbook是专为AI设的社交平台,超150万个AI Agent活跃。有人认为它是突破,也有人觉得只是娱乐展示。其背后或有人为操纵,还藏风险。Karpathy既肯定其规模,也提醒有网络效应和安全问题。
谷歌黑魔法,没人能看懂的Gemini 3 Flash
Gemini 3 Flash速度快3倍且智力超Pro,但没人明白其更「聪明」的原因。它打破「参数即正义」逻辑,在多项测试领先。谷歌或靠TPU、算法、数据优化,还可能用了Titans架构,有重大战略意义。
团队授权:分散化的架构决策
文章以黏菌创建网络为隐喻,探讨软件团队去中心化架构决策。介绍转型历程,包括重组团队、建立建议流程、创建上下文图等,阐述各环节作用、挑战与收益,强调其能提升决策质量与团队参与度。
比NanoBanana更擅长中文和细节控制!兔展&北大Uniworld V2刷新SOTA
兔展智能与北京大学的UniWorld团队推出图像编辑模型UniWorld - V2,它提出UniWorld - R1框架,在权威测试中超越顶尖闭源模型。该框架通用性强,能提升其他基础模型性能,相关论文、代码和模型已开源。
哪个大学生能拒绝帮你搞定 Office、编程、设计的全能搭子?
国务院印发意见明确智能应用普及目标,高校也展开AI教育。Agent技术成大学生“新工具箱”,文章介绍其概念、运行方式,还以扣子空间为例展示在学术和校园生活场景的应用,最后公布了相关活动信息。
蚂蚁专用模型超越o3!仅用2K训练样本刷新医疗AI榜单纪录
蚂蚁集团联合团队发布《MedResearcher-R1: Expert-Level Medical Deep Researcher》报告,其医学AI智能体MedResearcher-R1用2100条训练样本在医疗基准测试反超通用大模型,靠数据、工具、训练方法三大创新实现突破。
从Prompt到Context:为什么Think Tool是形式化的必然?
文章从编译原理视角,为AI工程实践提供理论根基。分析了Prompt和Context Engineering的形式化程度,介绍Anthropic的Think Tool,指出其优势及对CoT的超越,还提及未来需为Agent System发展全面形式化理论。