「无门控测试」共找到 2295 篇相关文章
AI Coding 赛道,Solo 创业、6 个月 8000 万卖掉,独立开发的新传奇
Maor Shlomo开发全栈无代码平台Base44,6个月获25万用户后8000万美元卖掉。他复盘了从搭建到推广的全流程,分享产品切入点、与AI协作、渠道增长等经验,强调做喜欢之事,把握用户‘顿悟时刻’。
10年顽疾ChatGPT一眼识破!AlphaGo时刻震撼全球医疗界
患者被莫名病症折磨多年,医生无解,将病史输入ChatGPT后病因被识破。AI工程师认为医疗AI第二诊疗意见应成规范,有人称这是医疗界的「AlphaGo」时刻。微软等巨头布局,其MAI - DxO准确率超人类医生。
钉钉做多维表,最大的底气是自家的电商
钉钉创始人无招回归后对产品走查改造,还拆付费墙,多维表全功能免费。它类似Excel但侧重协同,借阿里电商体系优势推行业化应用,解决AI落地难题,是实用的数智化小工具。
【博客转载】CUDA Shared Memory Swizzling
文章讨论用swizzling技术处理CUDA共享内存bank冲突,它可重排索引映射避免冲突且不浪费内存。以矩阵转置为例,对比有冲突、填充、swizzling三种实现,还分析了swizzling和填充优缺点。
Knowledge还是Reasoning?具体分析LLM答案正确,不代表思考过程靠谱的问题
斯坦福/加州大学团队指出大模型答案正确不代表思考过程靠谱,传统评估忽略思考路径问题。团队提出双维度评估框架,透视模型思考过程,还测试发现不同领域决胜关键、最佳训练法不同,且框架正解锁新场景。
AI七个月突破数学家“围剿”反超人类!14位数学家深挖原始推理token:不靠死记硬背靠直觉
大模型o3 - mini - high在7个月内,于FrontierMath基准测试中,答题得分从2%提升到22%,超人类团队平均水平。数学家分析其推理记录,发现它靠直觉而非死记硬背解题,但也存在缺乏创造力等局限。
时隔一年,再次使用7个国产AI大模型写高考作文,国产模型的进步也太大了!有彩蛋。
去年评测国产模型写高考作文能力时,各模型问题不少,如用词重复、字数不足。今年再次测试7个国产模型,能力有指数级提升,文采惊人,扣题方面通义千问和文心一言表现出色。文末还有海外模型“翻车”彩蛋。
多模态大模型不会画辅助线?最新评估得分:o3仅25.8%,远低于人类82.3% | 清华腾讯斯坦福联合
清华、腾讯、斯坦福等团队发布RBench - V基准测试,评估大模型视觉推理能力。结果显示,主流大模型如o3、Gemini2.5等准确率远低于人类,开源模型表现更差,暴露出大模型在复杂多模态推理任务中能力不足。
ICML 2025 | 注意力机制中的极大值:破解大语言模型上下文理解的关键
ICML 2025新研究揭示,在使用RoPE的现代Transformer模型里,注意力机制Q和K表示有集中极大值,V表示无此模式。研究通过实验明确极大值与上下文知识理解的联系,对模型设计、优化和量化有重要启示。
ICML 2025 | 注意力机制中的极大值:破解大语言模型上下文理解的关键
ICML 2025新研究揭示,在使用旋转位置编码 (RoPE) 的现代Transformer模型中,注意力机制的查询 (Q) 和键 (K) 表示存在集中极大值,而值 (V) 表示无此模式。研究通过实验揭示其与上下文知识理解的关键联系。