「Opus-4.8」共找到 1986 篇相关文章
全球首个自主科研Agent挑战赛!零人工干预冲击CNS成果SOTA,科研变天?
3月1日,由上智院和复旦大学主办的‘AI4S智能体CNS挑战赛’启动报名。赛事聚焦自主科研智能体,设四项挑战任务,要求零人工干预,超越CNS成果SOTA。评审阵容强大,旨在推动科研范式变革。
菲尔兹奖成果首次被AI完整形式化,Gauss20万行代码改写数学史?
Math, Inc. 公司用 Gauss 智能体完成 8 维和 24 维空间最优球体堆积定理形式化证明,代码约 20 万行。该定理最初由 Maryna Viazovska 及其合作者证明,这是本世纪首个被完全形式化证明的菲尔兹奖成果。
Claude 急了!模型降智,官方长文用 bug 搪塞?开发者怒怼“太晚了”:承认不达标为何不退钱?
8 - 9 月初Claude模型质量下降,Anthropic发文解释是因三项基础设施漏洞。介绍了三个bug及处理办法,也分析检测难的原因并给出改进方案,但很多用户已不再买账,Claude用户流失问题持续。
张益唐孪生素数猜想,被GPT-6破新纪录! 北大数学07级苏炜杰:很震撼
2026年9月3日,OpenAI宣布GPT - 6将孪生素数问题最好上界推进到186,打破陶哲轩保持十二年的纪录。此前Julia Stadlmann推到240,Axiom Math压至212。GPT - 6展现数学直觉,证明经Lean 4验证。
重要!LiteLLM 供应链攻击:你的 API 密钥可能已经泄露
3月24日,LiteLLM的PyPI发布页面出现恶意版本,1.82.7和1.82.8被嵌入恶意代码。恶意代码会收集敏感文件、外传信息、进行横向移动。文章还给出检查、处理方法,此事件给开发者提了醒。
27、42、73,DeepSeek这些大模型竟都喜欢这些数!为什么?
技术作家发现GPT - 4o、Claude等模型猜数偏好42、73,Andrej Karpathy测试中模型多选27。网友猜测原因,如数据集、人类偏见等,也有论文分析此现象,多与数据分布有关。
AI 精神病的巅峰:Claude Mythos 和 OpenAI Spud 还没上线,就有人度假都睡不着了
还未发布的Claude Mythos和OpenAI Spud在舆论场引发热议,大众情绪被拉高。OpenAI推出GPT - 5.4 - Cyber,还跟进‘安全’故事。网友对‘模型太危险只能少数公司用’说法存疑,同时GPT - 6等新模型消息不断。
小米双模型正式开源!MiMo-V2.5-Pro无中断肝出“macOS”:54个应用全开、浏览器真能冲浪
小米MiMo-V2.5系列模型正式开源,权重全量开放。该系列含四大模型,综合实力对标国际顶尖水准。MiMo-V2.5 Pro能力出色,如4小时无中断完成“macOS”系统,且Token效率高省成本。小米还推出开发者扶持计划。
实测吓一跳,gpt-5.6居然比deepseek flash还便宜
上周GPT-5.6 luna打2折,次日梁圣的v4flash正式版发布。经实测,把GPT薅到极致比DeepSeek便宜,还整出无限活力流玩法。Luna max智力分值超Sol high,虽耗时久但成本低。
程序员岗位暴增11%,华尔街研报击碎失业恐慌:你的饭碗比想象安全
一份‘AI末日论’报告引发华尔街恐慌,软件股市值蒸发超2000亿美元。Citadel Securities报告反驳,用数据表明软件工程师招聘增11%,失业率仅4.28%,指出AI普及慢且有物理边界,不是就业末日,能对冲经济下行。