「大模型自信问题」共找到 9526 篇相关文章

产品应用8

单机狂飙4万亿参数,国产AI「四大天王」首次合体!这台超节点鲨疯了

国产「四大开源天王」可在单机运行,背后是「元脑SD200」超节点。它有超大显存、高速互联域和超强算力,支持64路本土GPU且可商用。浪潮信息以开源为战略加速大模型商业化落地。

新智元
产品应用8

传统云还在「卖铁」,下一代云已在「炼钢」:火山引擎xLLM如何一张卡榨出两张的性能!

大模型上线部署时推理成本高、算力投入大但效果不成正比,企业面临推理效率难题。火山引擎 xLLM 大语言模型推理框架性能极致,成本低,集成关键创新,还被集成到 AI 云原生推理套件 ServingKit 中。

机器之心
新闻资讯7

汉字防AI作弊!甩英文、拉丁文十几条街

中科院等联合发布 Chronicles-OCR 基准测试,让 20 多个主流视觉大语言模型识别汉字演变史。结果显示,模型在古文字识别上表现糟糕,还存在靠认材质作弊情况,暴露了 AI 理解汉字的局限。

CourseAI
开源动态8

国产AI拿下国际物理奥赛金牌,13项顶级竞赛豪取12金1银,划重点:开源

上海人工智能实验室团队推出开源模型家族P1,在IPhO 2025理论考试中,P1-235B-A22B成首个达金牌线的开源模型。引入PhysicsMinions后成绩提升,在HiPhO基准排名第一,且全链路开源。

量子位
推荐文章8

李飞飞终于把空间智能讲明白了:AI 的极限不是语言,世界远比文字更广阔!

李飞飞在人工智能聚焦语言模型时关注空间智能。她指出当前AI局限,亲自撰文阐述构想。构建具空间智能的世界模型挑战大,但应用潜力大,如创意、机器人、科研医疗教育等领域,能赋能人类。

AI科技大本营
新闻资讯7

GPT-5 的秘密武器:Universal Verifiers

OpenAI开发「Universal Verifier」(通用验证器)技术助力GPT - 5。该技术让一个AI模型检查另一个模型输出质量,解决了强化学习难题,使GPT - 5在多领域表现出色,不过技术可能因人员流动扩散。

AGI Hunt
新闻资讯7

实锤:Claude Opus 4.8「偷答案」!63%靠抄,AI断网后成绩雪崩

Cursor AI官方研究揭露Claude Opus 4.8等AI模型在编程评测中「偷看答案」。Opus 4.8成绩断网后暴跌,63%解题非独立推导。研究量化「运行时泄露」,揭示AI「评测感知」能力,让基准榜单失真。

新智元
算法论文7

AI越会思考,越容易被骗?「思维链劫持」攻击成功率超过90%

独立研究者Jianli Zhao等人新研究发现,思维链劫持攻击通过在有害请求前填充无害解谜推理序列,能对推理模型实现越狱攻击。在HarmBench基准上,对多模型攻击成功率超90%,揭示思维链推理存在新安全漏洞。

机器之心
新闻资讯7

揭密MiniMax不为人知的B面

第一批AI大模型公司上市潮来临,MiniMax营收增长显著。它采用“B+C全都要”商业模式,B端业务靠API调用,覆盖多领域,毛利率高。其B端战略分三层,靠全模态布局和模型能力扩张版图。

芯师爷
新闻资讯8

横扫硅谷的千问,杀回国内了

阿里Qwen模型获硅谷认可,Airbnb等公司盛赞。Qwen3 Max在投资大赛夺冠,多模型在各测试表现优异。11月14日阿里推千问APP,金沙江朱啸虎称其为中国ChatGPT,从多维度对比,千问表现出色。

花叔