「通用推理能力」共找到 5107 篇相关文章
AI在「赚钱锦标赛」夺冠,比人类还会做生意!躺赚时代要来了?
研究人员提出自动售货机运营模拟环境Vending - Bench,测试大模型智能体管理业务能力。实验显示不同大模型性能方差大,Claude 3.5 Sonnet净资产表现最佳,人类基线在可靠性上表现较好,各模型长周期表现波动大。
统计可控数据合成!新框架突破大模型数据生成局限,麦吉尔大学团队推出LLMSynthor
麦吉尔大学团队提出新方法LLMSynthor,让大模型成结构感知的数据模拟器,为隐私敏感、数据稀缺场景生成不泄密的高质量替代数据。它通过结构推理、统计对齐等步骤实现,有理论保障,多场景实测效果佳。
大模型狙击黑产:挚文集团社交生态攻防实战全揭秘
挚文集团生态技术负责人李波在AICon大会分享大模型在社交生态落地实践。介绍集团生态问题,提出构建治理框架,还阐述多模态大模型研发方案、细粒度用户画像建设及审核侧应用,最后总结现状并展望未来。
Claude自主发现类CRISPR新酶系统,但还不知道它能干什么,张锋点评:值得研究
本文报道Anthropic旗下Claude大模型独立完成搜索分析,从噬菌体DNA中发现此前未被发现的类CRISPR新酶系统ART,展示了大模型在生命科学新发现中的独特能力,目前ART功能尚未明确,张锋点评其值得进一步研究。
GPT-6第1天直接攻破5道Erdős难题!Fable 5.1交了白卷
Epoch AI和曼彻斯特大学发布FME基准测试论文,让68道未解数学难题成5个顶级AI的考场。GPT - 6 Astra成唯一得分非0分模型,放宽预算共解开5道,其余4个AI全交白卷。该测试是对陶哲轩批评的回应。
给Cursor、Claude Code装上这个CLI,能变现
teamai-cli 是腾讯开源的命令行工具,能集中管理团队调教 AI 编程助手的成果,同步给全团队。它复用软件工程方法,解决 AI 协作中经验不沉淀、行为不一致等问题,让 AI 能力从个人资产变为团队资产。
AICon 深圳 2026 全日程揭晓|聚焦 Agent 工程化,构建可靠智能的技术路径
8月21 - 22日,AICon全球人工智能开发与应用大会将在深圳举办。大会全日程已发布,产业一线技术专家将围绕Agent工程化等前沿方向,分享技术探索与工程实践,探讨AI从能力突破走向系统构建的新路径。
对话 IDEA 张磊:「不以动作为输入条件,就不叫世界模型」
本文是对IDEA研究院张磊的深度访谈。张磊在计算机视觉领域成就斐然,他指出具身智能落地需攻克成功率、泛化性等挑战,大脑比本体更关键。还阐述了世界模型概念及应用,定义其应具备动作依赖等内容。
AI给你的总是平庸答案?5.8万星插件证明:问题不在模型,在你
GitHub上5.8万星的`taste-skill`仓库,无模型代码,仅用文本规则让AI编程工具输出更有品味。揭示AI默认给平庸答案是概率采样结果,还给出反中位数三问及AI时代变贵的是判断力。
Sonnet 5 翻车!同性能价差最高 56倍,海外巨头为何复刻不出 DeepSeek?
Anthropic发布Claude Sonnet 5,官方称补足了Agent能力,价格优惠,但开发者反应不佳。Sonnet 5因tokenizer换代,实际使用成本更高,且比同类模型贵。与之相比,DeepSeek V4 Pro便宜很多,其靠技术实现低价,海外厂商难以复刻。