「测试工具」共找到 3440 篇相关文章
扩散模型+自进化:这篇论文让Deep Researcher错误率直降70%
论文提出测试时扩散深度研究代理(TTD-DR),将报告生成建模为扩散过程,有组件自进化机制和动态闭环设计。实验显示其在多领域研究任务超现有方案,为AI研究助手落地提供新范式。
大模型再爆弱点!旧记忆忘不掉,新记忆分不出,准确率暴降 | ICML'25
弗吉尼亚大学和纽约大学研究人员用「前摄干扰」概念设计测验PI - LLM,测试大语言模型(LLM)上下文检索能力。结果显示,随干扰增加,模型准确率对数下降至零,提示工程效果有限,需调整模型架构或训练范式。
DeepSeek-R1超级外挂!“人类最后的考试”首次突破30分,上海交大等开源方案碾压OpenAI、谷歌
上海交大联合深势科技团队发布新研究,在“人类最后的考试”(HLE)上获32.1分创纪录。团队推出工具增强推理智能体X - Master、多智能体工作流系统X - Masters并开源,方案表现优于OpenAI、谷歌相关模型。
钉钉为 AI 找了个绝佳工位
随着AI浪潮袭来,企业让AI Agent落地提效遇难题。钉钉以数据表格为架构实现AI应用化,将单元格变为AI“工位”,汇集AI工具、沉淀业务系统,还融合表格与文档、支持提醒功能,解决企业痛点。
钉钉做多维表,最大的底气是自家的电商
钉钉创始人无招回归后对产品走查改造,还拆付费墙,多维表全功能免费。它类似Excel但侧重协同,借阿里电商体系优势推行业化应用,解决AI落地难题,是实用的数智化小工具。
思维锚点:破解LLM Reasoning黑箱的关键句
文章提出思维锚点概念,指推理轨迹中影响后续步骤和答案的关键句。开发三种归因方法,系统论证高级组织句影响力更大,锚点主导错误修正。研究为理解LLM推理机制开辟新途径,开源工具支持可视化分析。
【博客转载】CUDA Shared Memory Swizzling
文章讨论用swizzling技术处理CUDA共享内存bank冲突,它可重排索引映射避免冲突且不浪费内存。以矩阵转置为例,对比有冲突、填充、swizzling三种实现,还分析了swizzling和填充优缺点。
72小时AI生存挑战,发生了什么?
五源发起72小时AI生存挑战,7位不同背景参与者在封闭空间,仅用AI工具和100元资金生存并创造。有人训练AI朋友,有人创作作品。过程中暴露诸多问题,也让大家看到AI能力边界与未来可能。
Mistral AI发布一站式编程助手Mistral Code
法国开源大模型平台Mistral AI发布一站式编程助手Mistral Code,旨在解决企业开发人员使用AI编码工具时的合规与安全障碍。它基于Continue开发,集成四个大模型,还能在私有代码库微调,获早期客户认可。
Knowledge还是Reasoning?具体分析LLM答案正确,不代表思考过程靠谱的问题
斯坦福/加州大学团队指出大模型答案正确不代表思考过程靠谱,传统评估忽略思考路径问题。团队提出双维度评估框架,透视模型思考过程,还测试发现不同领域决胜关键、最佳训练法不同,且框架正解锁新场景。