「基准表发现」共找到 1843 篇相关文章
AI取代放射科医生还早!Karpathy最新发声:软件工程师也不会失业
Andrej Karpathy发文推荐‘AI并未取代放射科医生’文章,并分享对AI与就业市场关系看法。他指出外界对AI影响就业有‘天真预测’,还阐述用AI取代放射科医生不易的原因及工作因AI变化的标准。
大模型破译甲骨文创下新SOTA!复旦团队推出新框架
复旦大学团队提出基于部首和象形分析的可解释甲骨文破译框架,构建PD - OBS数据集。该框架在公开基准数据集上准确率高,零样本破译能力强,能输出可解释分析文本,助力考古破译。
斯坦福:优化器「诸神之战」?AdamW 凭「稳定」胜出
斯坦福大学 Percy Liang 团队研究指出,虽有不少声称能显著加速的优化器替代方案,AdamW 仍为预训练稳健首选,但矩阵型方法在特定数据–模型比例下优势明显。研究还揭示了现有研究的方法论缺陷。
Nano Banana 邪修之王最强科研成果!教你自定义生图比例!
Nano Banana 出图有分辨率低和比例不可控问题。作者发现用垫图方式可控制其生图比例,已生成图片也适用,还给出操作方法、提示词,介绍不同平台效果及案例图下载方式。
自搜索强化学习SSRL:Agentic RL的Sim2Real时刻
本文由多机构联合完成,引入自搜索强化学习SSRL。它利用结构化prompt和format reward提取模型world knowledge,降低幻觉。还探索Sim2Real有效性,验证SSRL训练模型在真实场景泛化性,且所有训练数据等已开源。
啊?猫猫也会老年痴呆
《欧洲神经科学杂志》新研究表明,老年猫大脑会积累淀粉样蛋白β斑块,可能导致痴呆样行为。研究成果或助开发猫痴呆症疗法,也为人类阿尔兹海默症提供新见解。
大模型能否为不同硬件平台生成高性能内核?南大、浙大提出跨平台内核生成评测框架MultiKernelBench
深度学习计算依赖底层内核,当前多由开发者手工编写。南大、浙大推出开源评测框架MultiKernelBench,打破现有评测基准局限,构建模块化评测体系,多模型实测,还指出LLM短板并明确未来方向。
SimpAgent (ICCV2025 Highlight):上下⽂简化重塑GUI智能体,更少计算,更强性能
在多模态大模型加持下,纯视觉GUI智能体成通用操作智能体重要方向,但面临元素与历史上下文问题。哈工深和华为提出SimpAgent,从上下文简化建模入手,实现更快更强性能,工作被ICCV 2025录用。
刚刚,谷歌「IMO金牌」模型上线Gemini,数学家第一时间证明猜想
本周五,谷歌向 Google AI Ultra 订阅用户推出 Deep Think 功能,提供全版本 Gemini 2.5 Deep Think 模型给部分数学家。该模型是获 IMO 金牌模型变体,速度更快,有并行思维等技术,在多领域有用且测试成绩优。
The Batch: 855 | 为智能体而生
总部位于北京的 Moonshot AI 发布 1 万亿参数的 Kimi K2 系列大语言模型,包括预训练和微调版本。它输入输出能力强,架构独特,在多基准测试领先,支持工具调用,多家服务商已集成。