「前端开发测试」共找到 3217 篇相关文章
只因一个“:”,大模型全军覆没
一篇论文发现冒号等符号、“Thought process:”等语句能欺骗LLM,让虚假回答通过。实验表明所有测试模型都会触发假阳性响应。研究人员构建新“评委”模型Master - RM,可让假阳性率接近0%。
比10年专业医生准4倍!微软发布突破性医疗AI系统
微软首席执行官分享新发布的医疗AI系统MAI - DxO,它模型无关,能适配不同语言模型,模拟医生诊断流程。测试显示其准确率远超专业医生,成本大幅下降。此外还发布序贯诊断基准SDBench。
成立仅6个月的AI公司,卖了8000万美元
著名SaaS平台Wix以8000万美元收购AI开发平台Base44。Base44核心产品是AI编程平台,能依自然语言提示生成全栈应用程序。收购后,Wix业务版图拓展,向对话式AI平台转型。
直播预约 | 强化学习训练能否不依赖外部知识优化模型的弱点?
论文提出 SwS 框架,针对强化学习场景,利用模型自我感知弱点驱动自动化问题生成,合成针对性训练数据。还对其进行多项扩展,在多个基准测试集和模型上验证有效,性能提升显著。
斯坦福临床医疗AI横评,DeepSeek把谷歌OpenAI都秒了
斯坦福最新大模型医疗任务评测,构建含35个基准测试的MedHELM综合评估框架。结果显示,DeepSeek R1以66%胜率领先,o3 - mini等模型也各有表现,还分析了成本效益。
Grok最新模型吃上Cursor「加餐」,马斯克:Coding实现巨大改进
马斯克在X上透露,xAI的Grok基础模型V9 - Medium(1.5T)完成训练,预计2 - 3周后发布,训练加入大量Cursor数据。同时,xAI的AI编程代理工具Grok Build进入早期Beta测试阶段。
从 0 到 25 万行:一个 100% AI 编码项目,真正难的不是生成,而是治理
作者分享 Routa 项目用 AI 驱动开发的经验,指出 100% AI 编码项目真正难的是治理。介绍多个工具参与情况,阐述项目长出反馈系统的过程,包括规则入口、上下文收敛、提交前约束及仓库级裁决等。
刚开源仅3天狂揽4.9K star,轻量超高效版OpenClaw,10美元硬件就能跑!
OpenClaw火遍全网但硬件要求高、成本不菲。新开源的PicoClaw是其轻量替代方案,由Sipeed开发,内存占用少、启动快、成本低、便携性强,安装简单,功能多样,刚开源就成热议新星。
蚂蚁集团扩散大语言模型新突破:超800Token/s,速度与质量兼得
蚂蚁集团将LLaDA更新到2.1,通过引入“草稿 - 编辑”机制,打破扩散模型推理速度与质量的对立僵局。它有极速和质量两种模式,还采用混合训练流程及强化学习,在多基准测试中表现出色。
Vercel 开源 Bash 工具:基于本地文件系统的上下文检索
Vercel开源bash - tool,为AI智能体提供Bash执行引擎,让其通过shell命令在文件夹操作获取上下文,有三大核心操作,部署灵活,可节省token,贴合Unix工作流,或影响未来AI开发系统处理本地上下文方式。