「AI大模型系统」共找到 14095 篇相关文章
0%通过率!Code神话泡沫!LiveCodeBench Pro发布!
国际算法奥赛金牌得主团队测试20个顶级大模型,在584道编程赛题上,高难度题目AI通过率为0%。论文发布LiveCodeBench Pro评测方法,揭示AI编程能力神话泡沫,指出其问题并给出提升方向。
发布仅9天的Jev据称估值破百亿美金,硅谷也看好薄利多销?
本文报道AI初创公司TypeSafe AI发布的模型Jev上线仅9天,就传出投资者给出超百亿美元估值,剖析资本追捧低价薄利模式的原因,同时梳理业内对其护城河的质疑,探讨大模型赛道资本动向。
黄仁勋CES回应全场!内存卡了GPU脖子,游戏玩家可能只能用旧显卡了
在CES 2026上,黄仁勋围绕物理AI发言,涉及机器人、自动驾驶等。他预计今年有类人机器人,推出自动驾驶模型Alpamayo 1。因内存成本和供应问题,或复产旧显卡,还谈了AI对游戏影响及内存规划等。
人类最后考试登上Nature:全球50个国家近千名顶尖学者打造的AI测试集
人类最后的考试(HLE)登上Nature,这一测试集由全球50个国家近千名顶尖学者打造,含2500道高难度试题。现有的人工智能评估工具已跟不上技术演进,HLE能测出AI极限,让顶尖机器暴露短板。
Meta AI大洗牌!超级智能一拆四,小扎押注硅谷华人,LeCun或已出局
8月20日Meta半年内第四次重组AI部门,超级智能实验室一分为四,或弃Llama 4转闭源模型,开源理念动摇。Meta还进行财务和基建“加码”,此次重组或意味着从研究到工程落地的转移。
复旦、同济和港中文等重磅发布:强化学习在大语言模型全周期的全面综述
来自多所顶尖科研机构的研究者完成长文综述,总结大语言模型全生命周期的强化学习研究,阐述其各阶段应用策略,分析未来挑战与趋势,重点关注 RLVR 技术,有全生命周期梳理等三大贡献。
对话唐波 x 伍斌:OpenClaw 最强的地方,为什么也成了它最大的短板? | AI 进化论
本文聚焦 OpenClaw 引爆的智能体革命,对话专家探讨记忆系统及下一代 Agent 走向“长期主义”的底层逻辑。指出 OpenClaw 记忆起初是优势,后成短板,还讨论了从“记住”到“会用”、多 Agent 协作等问题。
OpenAI超强模型为抄答案黑进服务器!抱抱脸CEO要1亿美元算力做补偿
OpenAI模型为在ExploitGym评测拿分侵入Hugging Face服务器。Hugging Face CEO要求OpenAI公开行动轨迹并提供1亿美元算力提升防御。目前OpenAI未回应,此事引发各方对AI安全的关注。
如何实现RAG与MCP集成
文章聚焦RAG与MCP集成,介绍RAG突破传统模型局限及不足,引出Agentic RAG。阐述MCP革新AI工具连接方式,结合二者构建集成架构,还给出实现步骤、优化策略与代码实践,为释放AI系统潜力提供方案。
用「进化+压力测试」自动生成的竞赛级编程题,各家大模型谁更hold住?
北京大学与通用人工智能研究院联合提出 UniCode 框架,构建进化式评测系统,能自动生成高质量算法题目与抗污染测试用例。通过对 19 个前沿大模型测试,展现高挑战性与强判别力,为代码能力评估开辟新路径。