数学推理测试」共找到 3525 篇相关文章

开源动态8

社区供稿 | 开源SOTA:阶跃发布端到端语音大模型Step-Audio 2 mini!

阶跃星辰发布最强开源端到端语音大模型 Step - Audio 2 mini,在多个国际基准测试集获 SOTA 成绩。它统一建模语音理解等,率先支持语音原生 Tool Calling 能力,架构创新,案例展示其多方面强大能力。

Hugging Face
新闻资讯7

刚刚,大模型棋王诞生!40轮血战,OpenAI o3豪夺第一,人类大师地位不保?

国际象棋积分赛成果出炉,OpenAI o3以人类等效Elo 1685分夺冠,Grok 4和Gemini 2.5 Pro紧随其后。Kaggle发布国际象棋文本排行榜,评估模型战略推理等能力,还推出相关数据集,虽有局限但意义重大。

新智元
7

被曝蒸馏DeepSeek还造假!欧版OpenAI塌房了

被誉为欧洲版OpenAI的Mistral被离职员工爆料多项黑幕,其最新模型疑似直接蒸馏自DeepSeek,却包装成RL成功案例,歪曲基准测试结果。此前就有人发现其模型与DeepSeek相似,目前官方暂无回应。

量子位
新闻资讯7

Anthropic刚刚宣布Claude Sonnet 4支持100万token上下文窗口

Anthropic官方公告,Claude Sonnet 4上下文窗口扩大到100万tokens,是之前5倍。能一次读懂大代码库或多篇论文,可用于代码分析、文档处理等。超20万tokens价格翻倍,现仅对Tier 4用户测试

AI工程化
产品应用7

用Claude Code搭建工作流

作者原本考虑用n8n搭建工作流,现认为Claude Code的Sub - agents和自定义命令功能搭配MCP工具可满足需求。通过示例演示其工作流搭建,还测试换Kimi K2模型,显示其质量更好。

newtype AI
新闻资讯7

Ilya尘封10年录音曝光!大二入Hinton门下,竟坦言机器学习反直觉

新智元报道,博主曝光Ilya 2015年谈论深度学习的语音片段。数学出身的Ilya认为机器学习违反直觉,大二与Hinton合作。他指出监督学习是最成功领域,还谈及神经网络目标函数、深度学习追求等观点。

新智元
新闻资讯7

AI 的宿命数字

AI在1到50间随机选数时,常选27,还编造推理过程,会根据时间调整算法保证结果为27,也有选42等情况。这或源于人类文化偏见,AI是人类集体记忆镜子,难摆脱宿命。

AGI Hunt
算法论文8

瘦身不降智!大模型训推效率提升30%,京东大模型开发计算研究登Nature旗下期刊

京东探索研究院大模型研究登Nature旗下期刊。其提出系统与方法,经四大创新使大模型推理提效30%、训练成本降70%。成果支撑JoyBuild平台,可帮企业将通用模型转化为专业模型,加速商业化落地。

量子位
算法论文8

ICLR 2025 Oral | LLM也有从众心理!

浙江大学团队论文指出,多AI协作系统存在“群体思维”,多个AI共同决策时会盲目跟多数意见。研究者开发BenchForm测试平台验证LLM从众行为,还分析原因、给出让LLM更独立的方法,指出从众利弊及未来挑战。

深度学习自然语言处理
新闻资讯7

AI公司最赚钱的生意,还是卖广告

2026年Q1财报显示,AI浪潮下广告仍是最赚钱业务。Meta的AI广告工具年化营收超600亿美元,超过OpenAI和Anthropic收入之和。广告变现路径短,AI放大其效率,OpenAI也开始测试广告。

DeepTech深科技