「功能测试」共找到 3141 篇相关文章
The Batch: 972|Grok 的 Cursor 联盟获得回报
SpaceXAI发布与Cursor联合开发的视觉 - 语言模型Grok 4.6,已向开发者开放。介绍其输入/输出、特性等信息,阐述工作原理、性能表现,还提及相关新闻背景、重要原因及期望。
免费AI办公套件真香,节省一大笔会员费
Genspark团队开源AI办公套件GenOffice,全平台免费无广告。它界面类似微软Office,零成本上手,AI能直接编辑文档。虽处Alpha阶段,但可切换多种模型,还给出了配置第三方模型的方法。
上周 GPT 和 Codex 各有一个发布,很多人没注意吗?可以解锁 Codex 百万上下文了
最近基模发布多,OpenAI 俩更新被低估忽略。一是 GPT - 5.6 Sol 的 Ultrafast 模式,输出最高达每秒 750 Token,先向少量 API 客户开放;二是 Codex 为其开放百万上下文能力,不过大窗口有代价。
刚刚,Opus 5来了:性能不输 Fable 5、价格砍半
Anthropic 发布新一代模型 Claude Opus 5,其智能接近 Claude Fable 5 但价格减半。它在编程、知识工作等评测中表现出色,科研能力进步大,自主性与严谨性更强,安全对齐度高,防护兼顾安全与可用。
OpenAI 全面拥抱 Agentic-First,实测有点扎心
OpenAI发布GPT - 5.6系列,Sol定位长周期Agent,训练目标转向Agentic - First。但目前难以用上Sol,且其评测数据因计数规则差异大,还出现变身话痨、少说话和干完活难兼顾的问题。
2w star,网页秒变 AI 助手,厉害了!
阿里项目`PageAgent`登上Github热榜,是纯前端JavaScript GUI智能体框架。它让网页拥有AI Agent,通过自然语言控制界面,无需截图、OCR和多模态大模型,有多种功能特性,使用简单。
RPA要没了
Codex更新Record & Replay功能,虽与RPA表面都是录制操作、重复执行,但底层逻辑不同。RPA是指令式,有诸多缺陷;Codex是目标式,是RPA替代品,还构建了企业自动化体系。
今天起,Claude Design要把设计师和程序员变成同一种人了
Anthropic官宣Claude Design大版本更新,有四大亮点,如设计系统一键导入、代码双向同步等。设计师亲自演示新功能,还引出两条新命令。设计工具领域竞争激烈,背后是科技巨头抢占用户入口。
WWW'26 | 跨任务自适应的Multi-Agent协作新范式
大型语言模型驱动的多智能体系统成解决复杂任务重要范式,但智能体协作存在关键问题。Griffith和西北农林科技大学团队提出OFA - MAS,将多智能体拓扑设计从one - for - one推向one - for - all,实验效果佳。
阿里巴巴 & 蚂蚁 LoongSuite GenAI 可观测语义规范:从统一数据语言到规模化落地
随着GenAI发展,OpenTelemetry推动语义规范建设。阿里巴巴与蚂蚁联合推出LoongSuite GenAI SemConv,在OTel基础上增强,新增Entry/Step Span、Skill语义、Token级推理观测,还推出GenAI Utils简化插桩开发。