性别差距」共找到 257 篇相关文章

算法论文8

33%!Claude、GPT、Gemini 在真实网站上集体翻车,ClawBench 把 AI agent 打回原形

ClawBench让AI在144个真实网站执行153个日常任务,结果惨烈,如Claude Sonnet 4.6每三任务翻车两个,GPT - 5.4仅完成10个。它还揭示AI在真实环境的问题,为评估模型提供标尺。

机器之心
算法论文8

EMNLP 2026高分论文MathDebugger:当合成数据涌入训练集,如何为数学题做体检?

随着合成数据增多,模型需判断数学数据题目能否被信任。北大DCAI团队提出MathDebugger质检BenchMark,覆盖问答两端,评测主流LLM和PRM。还探究能否判断正误、分类错误、修复数据,证明错误标签可作监督信号。

InfoQ
开源动态8

高智商 ≠ 高财商?50天实盘测试:LMArena 高分王者也可能是「韭菜」

伊利诺伊大学厄巴纳 - 香槟分校团队开发 LiveTradeBench,让大模型在真实金融市场交易,检验其能力。它全面开源,有实时数据、组合决策等创新,50 天实测揭示模型财商差距

机器之心
产品应用7

ComposeMe:让发型、服饰与身份随心组合的人体图像生成新范式

人像生成中保持效果清晰真实且自由调整细节是难题,Snap推出ComposeMe,引入‘属性特定图像提示’思路,能灵活组合属性。还建立数据集、提出训练方法,虽有局限,但表现较优。

带你学AI
算法论文8

用LoRA微调VLM做乳腺癌病理分类,实战对比CNN

哈萨克斯坦团队论文对比CNN和用LoRA微调的VLM在乳腺癌病理分类上的表现。指出VLM微调后接近CNN水平,但CNN仍是王者。还介绍LoRA原理、实验设计、结果,给出实战代码及对从业者和研究者的启示。

机器学习AI算法工程
开源动态7

开源版 Claude Cowork

Multica是原生桌面客户端,将编程智能体能力带给大众,支持Claude Code等。它类似Obsidian,可按需定制,能解决编程智能体使用障碍,具备简洁界面等特性,还介绍了使用、开发、构建等内容。

GitHubStore
新闻资讯7

GPT-5“变笨”实锤,退休教授出了道井字棋送分题,结果它真送了

退休经济学教授用井字棋简单问题测试GPT - 5,其表现拉胯,与“博士级AI”宣传不符。后续操作离谱,或因OpenAI策略调整。此外,OpenAI在测ChatGPT新功能,奥特曼开始炒GPT - 6。

量子位
算法论文8

从「记忆解题」到「深度推理」:港科大推出首个本科数学动态评测基准 UGMathBench

港科大团队发表在 ICLR 2025 的研究 UGMathBench,是首个本科数学动态评测体系。它涵盖 16 个学科领域,通过变量扰动创建多版本试题,引入创新指标评估模型推理能力,测试结果揭示了当前模型短板。

AI科技大本营
新闻资讯7

大模型平台AI21 Labs获3亿美元D轮融资

Business Insider消息,大模型平台AI21 Labs获3亿美元D轮融资,由谷歌、英伟达领投。该公司创立于2017年,2025年3月推出新AI平台Maestro,可提升主流模型指令遵循准确性。

AIGC开放社区
8

CUDA 20年护城河一个周末崩了 !Claude独自跑通AMD新GPU

一个周末,Claude直接把自家最前沿模型跑在全新AMD MI355X机架,人类工程师没改一行代码。AMD还给AI开发调GPU的工具,ROCm.AI可让Agent自己部署操作。Agent补生态积累短板,对CUDA生态形成降维打击。

新智元