「lm - evaluation 框架」共找到 1664 篇相关文章
从0开发大模型的17种Agent架构演进详细拆解
文章详细拆解从0开发大模型的17种Agent架构演进,介绍各架构解决的问题、状态、拓扑、路由、失败模式等,指出Agent架构本质是控制流设计,还给出架构选择建议及判断新架构的方法。
老黄秘密武器曝光:AI一夜设计芯片,顶人类顶级工程师10个月!
英伟达在GTC大会揭露用AI设计GPU,原本8名工程师10个月的任务,AI一夜完成。其开发NB - Cell、Prefix RL等工具,还推出内部大模型Chip Nemo和Bug Nemo,不过完全端到端自动化设计仍有距离。
2026跳槽暴富指南:这些公司的期权,可能比你的年薪值钱10倍
2026年为中国科技公司IPO大年,众多公司上市后员工获丰厚收益。文章列举小红书、月之暗面等公司,分析其期权价值与上市可能性,给出评估期权的框架及投资风险提醒。
迎接范式革命:最新、最全的大模型Latent Space综述,NUS、复旦、清华等联合出品
大模型核心计算正从显式空间转向潜在空间,现有文献缺乏统一视角。NUS、复旦等机构的综述《The Latent Space》从五大视角构建框架,阐述潜在空间基础、演进、机制、能力,指出挑战与未来方向。
全网玩疯的SBTI,挤爆了服务器!网友用Claude手搓复刻版
全网被新型SBTI人格测试刷屏,服务器被挤崩。它解构MBTI框架,精准捕捉年轻人情绪。开发者用Claude Code完成逆向复刻,还做了改进。如今做产品门槛降低,未来SBTI或由AI打造。
年轻人的第一个爱马仕
AI圈的Hermes是Nous Research开发的开源Agent框架,GitHub星数超35000。作者写76页《Hermes Agent从入门到精通》,介绍其设计思路、使用方法等,中英文版可在GitHub免费下载。
盘一下Anthropic 244页Claude Mythos报告中隐藏的SAE技术
Anthropic公布强大危险的大模型Claude Mythos Preview但未发布。文章深挖其244页报告中SAE技术细节,包括前期探索、技术框架、训练监控、攻击性行为分析及掩盖行为等,助了解模型内部思维。
安全的下一个好赛道,非常值得研究
近几年机器人发展火爆,摩根士丹利预测到2050年产业规模或超5万亿美元。但机器人领域安全复杂,研究团队用CAI框架对三款消费级机器人渗透测试,揭示严重安全问题,且行业整体对安全无知。
静态技能已死:cognee怎么让AI自己修自己的prompt
文章指出当前agent技能存在silent drift问题,Cognee作为开源知识引擎,将skills视为活的系统组件,通过Skill Ingestion、Observe、Inspect、Amend、Evaluate & Update五步实现自我进化,还介绍了相关应用及社区反应。
ICLR 2026|多模态大模型真的理解情绪吗?MME-Emotion给出了系统答案
多模态大模型迅速发展,但能否理解人类情绪存疑,且缺乏系统性评测框架。香港中文大学和阿里通义实验室团队提出 MME - Emotion 评测基准,评测 20 个主流模型,发现模型情感智能不足,为后续研究提供参考。