测试技术」共找到 4383 篇相关文章

算法论文8

斯坦福新论文:微调已死,自主上下文当立

斯坦福大学等机构研究人员新论文指出,依靠上下文工程,无需调整权重,模型也能变聪明。他们提出智能体上下文工程ACE,不依赖模型重训,让上下文自主进化,在多场景测试中表现优于多种方法。

量子位
产品应用7

Cursor 1.7 新增 Agent 生命周期管控钩子函数

Cursor 1.7 版本推出钩子系统,可在预定义生命周期节点拦截并修改 Agent 行为,如阻断命令、自动运行工具等。早期反馈有好有坏,虽有团队探索集成,但应用范围有限,还存在文档缺失等问题。

InfoQ
8

刚刚,OpenAI最强DevDay剧透!奥特曼发神秘预告,Jony Ive压轴登场

OpenAI DevDay即将开幕,奥特曼发文称有新东西助力AI开发。本届大会或成其在硅谷扩张宣言,将推出Agent Builder,或发布ChatGPT浏览器,还聚焦企业级AI应用,展示新兴技术体验区。

新智元
开源动态8

CAIR开源发布超声基座大模型EchoCare“聆音”,10余项医学任务性能登顶

2025年9月17日,CAIR开源发布超声基座大模型EchoCare“聆音”。它基于超450万张影像数据集训练,在10余项医学任务测试中表现卓越。首创结构化对比自监督学习框架,为AI医疗应用提供创新路径。

机器之心
新闻资讯8

马斯克新模型背后算法来自英伟达???

Grok-4-fast降本增效表现出色,其背后或许关联英伟达算法论文。论文推出Jet-Nemotron模型,靠PortNAS框架降本提效,还开源代码。网友猜测Grok-4-fast基于此模型,也有人认为是营销手段。

量子位
推荐文章7

AI 会替代产品经理吗?答案藏在这份白皮书里

阿里CEO吴泳铭提出ASI概念,判断AI发展路径。产品经理用AI面临抉择,现状复杂,仅32%认为显著提效。万字白皮书拆解AI与产品工作适配方式,还给出应用案例、提效技巧及工具推荐,探讨产品经理职业进化路径。

特工宇宙
开源动态8

CrowdStrike联手Meta发布AI安全基准,让AI在真实网络攻击中证明自己

美国网络安全巨头CrowdStrike与Meta在Fal.Con 2025大会联合推出开源基准测试套件CyberSOCEval,旨在评估AI大语言模型在真实SOC环境下的网络安全能力,它源于Meta之前框架,开源供全球开发者使用。

AIGC开放社区
开源动态8

Nano Banana不及格,开源模型一分难求!上海AI Lab新基准直击文生图模型痛点

上海人工智能实验室等联合发布首个多学科文生图考试基准GenExam,覆盖10学科、1000题。实验显示,GPT - 4o严格评分正确率仅12.1%,开源模型接近0分,暴露出模型在专业场景的短板。

量子位
产品应用7

一块画板,Nano Banana,无限创意:谷歌新工具实测

谷歌Labs推出AI概念板Mixboard,由Nano Banana图像模型驱动,整合Gemini 2.5 Flash模型。可上传个人图像混合编辑,适合设计师等。现仅在美国公开测试,速度快,操作便捷,能高效验证想法。

AI进修生
开源动态8

阿里新开源提出建设性安全对齐方案,向“让用AI的人安全”新范式跃迁

阿里巴巴集团安全部联合多高校发布技术报告,提出建设性安全对齐理念并集成到Oyster - I模型。该理念突破传统防御式机制,构建新博弈框架,实验显示该模型在安全和通用能力上达SOTA水平。

量子位