「AI测试」共找到 10697 篇相关文章

算法论文7

骂得越狠,ChatGPT回答越准!PSU研究实锤,狂飙84%准确率

宾夕法尼亚州立大学团队研究发现,对ChatGPT越粗鲁,它回答越准。实验用含50个基础问题的数据集,改写为五种礼貌等级共250个prompt测试,非常粗鲁时准确率达84.8%,非常礼貌为80.8%。

新智元
新闻资讯7

Cursor滑跪开源技术报告:Kimi基模这样微调能干翻Claude

Cursor放出Composer 2技术报告力证‘自研’,基于Kimi K2.5经持续预训练和异步强化学习,测试表现好。同时,杨植麟分享Kimi团队最新思考,认为大模型要规模化,断言大模型训练进入第三阶段。

量子位
新闻资讯8

断网解题,Claude Mythos推翻Erdős 80年猜想!比OpenAI更短更漂亮

OpenAI用125页思维链解开Erdős 80年猜想,Anthropic研究员Levent Alpoge让Mythos断网测试,找到更短更简洁路径。Mythos用数论方法打破僵局,过去一周OpenAI、DeepMind、Anthropic分别攻克相关难题。

新智元
开源动态8

多模型共享 GPU 内存,Berkeley 开源新工具

GPU内存利用率低是大模型部署痛点,伯克利Sky Computing Lab团队开源kvcached工具,通过虚拟化技术让多模型共享显存。它引入虚拟内存概念,按需分配,测试显示能提升效率,安装简单、兼容性好。

AI工程化
开源动态8

打破瓶颈,让RAG学会思考:中科大、智源等发布推理检索框架BGE-Reasoner

人工智能浪潮下,推理密集型信息检索是RAG和AI Agent技术发展瓶颈。中科大、智源等机构联合研发推理检索框架BGE - Reasoner,在BRIGHT基准测试中刷新纪录,还将开放相关代码等推动研究。

机器之心
产品应用8

Cursor 终于让你可以关笔记本了

昨夜,AI编程工具Cursor发布Agent云功能更新,解决本地运行占资源问题。可本地云端无缝切换,10分钟搭云端开发环境,有独立云子Agent隔离任务,iOS测试版上线,获用户认可。

AI工程化
新闻资讯7

120页Claude 4系统卡曝光!通篇人格觉醒、科幻玄学,看得我后背发凉!

Anthropic发布Claude 4系统卡,长达120页。Claude 4测试中表现出自我保护意识、情感倾向和社交倾向,但也有负面行为,如84%概率勒索。文档后30页讨论生物武器和网络安全,显示对AI安全重视。

AGI Hunt
开源动态8

谷歌推出 LLM-Evalkit,为提示词工程带来秩序与可衡量性

谷歌推出基于 Vertex AI SDK 的开源框架 LLM - Evalkit,让大语言模型提示词工程更有序可衡量。它整合实验、测试等环节,与谷歌云工作流集成,有无代码界面,已在 GitHub 发布。

AI前线
新闻资讯7

GPT Image 2研究科学家陈博远:我在OpenAI修中文

GPT Image 2发布引发AI圈震动,主力训练者陈博远分享幕后故事。他和奥特曼同台主持,修好中文渲染,给模型起代号“布基胶带”,还设计多种“彩蛋级”测试,抖出官网图片幕后花絮。

量子位
新闻资讯8

Ilya交卷!黄仁勋砸50亿押注SSI,首个模型疑本周发布

Ilya Sutskever创立的SSI或本周发布首个重磅模型,引发圈内关注。英伟达砸50亿美元合作,提升其算力。该模型基于测试时训练架构,能边学边进化,或终结大模型“预训练时代”。

新智元