「大模型测试」共找到 9665 篇相关文章
英伟达新“桌面超算”800GB大内存,满血DeepSeek R1能装1个半
英伟达在Computex大会宣布新办公室落户中国台湾省台北市,还推出多款新品。如面向个人的DGX Station有800GB内存,能跑大模型;面向企业的RTX PRO Server可加速多种用例。此外,还发布新平台、宣布合作等。
阿里开源长文本深度思考模型!渐进式强化学习破解长文本训练难题,登HuggingFace热榜
阿里开源长文本深度思考模型QwenLong - L1,登上HuggingFace热门论文第二。它解决了长文本强化学习训练难题,通过渐进式上下文扩展训练,在多基准测试中表现出色,还探讨了SFT和RL作用。
GPT5.5代号“蒜你狠”曝光!OpenAI拉响红色警报加班赶制新模型,最快下周就发
面对谷歌攻势,OpenAI奥特曼拉响“红色警报”,集中资源让ChatGPT赶上Gemini 3 Pro。两款新模型曝光,一款下周发布,代号Garlic的明年初或发。ChatGPT流量降,OpenAI财务压力大,Garlic能否助其破局受关注。
中美六大顶尖模型第一赛季实盘量化交易结果出炉:Qwen最后反超夺冠,GPT-5垫底「复盘」
Nof1机构发起Alpha Arena项目,让六个顶尖LLM在Hyperliquid交易所实盘量化交易。第一赛季已结束,Qwen夺冠、GPT - 5垫底。复盘比赛过程,发现模型行为差异大且操作有脆弱性,第二赛季筹备近尾声。
更大,还能更快,更准!蚂蚁开源万亿参数语言模型Ling-1T,刷新多项SOTA
10月9日,蚂蚁开源万亿参数语言模型Ling-1T。它延续自研高效MoE架构,在编程、数学推理等多维度测试表现亮眼,还能兼顾精确与效率。此外,它在多场景实用性强,其创新设计提升了能效比与性能。
实证:现在的LLM根本不会Reasoning!
论文指出当前大推理模型(LRM)如DeepSeek - R1等可能只是在表演“思考秀”,遇到复杂问题就崩溃。研究者用4个可控谜题测试,有三大颠覆发现,还揭示思考过程的荒诞现象,直指行业痛点并给出发展方向。
全国产算力托底、告别 AI 内卷,科大讯飞如何让每个人站在 AI 肩膀上?
本文围绕科大讯飞在AI领域的发展展开。董事长刘庆峰表示要让所有人共享AI红利,介绍了公司在多领域的应用成果,还发布全国产算力的讯飞星火X1.5模型,实现多项技术突破,推动AI融入现实生活。
Docker 通过 Cagent 提供 AI 代理确定性测试
AI 代理系统普及,工程团队面临测试概率性输出的挑战。Docker 的 Cagent 是一种 AI 代理确定性测试方法,采用 proxy - and - cassette 模型,虽处早期,但揭示了 AI 代理测试的不同方向。
谢赛宁团队新基准让LLM集体自闭,DeepSeek R1、Gemini 2.5 Pro都是零分
纽约大学等8家机构研究者提出LiveCodeBench Pro竞技编程基准测试,评估了Gemini 2.5 Pro等前沿大模型。发现当前模型有显著不足,在无外部工具时,高难度题通过率为0,LLM与人类大师级水平差距明显。
中英双语、29项第一、像素级理解:360 FG-CLIP2登顶全球最强图文跨模态模型
360推出FG-CLIP2图文跨模态VLM模型,在八大类任务、29项测试中超越Google与Meta。它能像素级看图,中英文皆强且已开源。其优势源于高质量数据集和先进训练方法,还在多业务落地并开放API。