「核心认知基准」共找到 2692 篇相关文章
「生化危机」女主用Claude手搓满分AI,一年0.7美元反杀大厂!
《生化危机》女主Milla Jovovich与工程师好友用Claude开源AI记忆系统MemPalace,在LongMemEval获全球首个满分。虽上线后被社区挑刺,团队公开认错,但其成绩和免费本地运行优势仍受关注。
10倍加速化学推理大模型!Haven团队在隐空间思考分子式,碾压显示CoT
Haven团队提出LatentChem,把化学推理从‘文本表面’挪到‘模型内部’,先在隐空间思考,再在语言空间回答。它拆分‘推理’与‘表达’,性能优异,为AI Scientist奠定基础。
开源一周狂揽 35K 标星!Karpathy 开源 autoresearch:630 行代码让 AI 自动“炼丹”!
前OpenAI、特斯拉前AI总监Andrej Karpathy发布新项目autoresearch,一周揽35.6k Star。它是极简版LLM训练环境,630行代码让AI自动做研究,人类通过Prompt指导,AI自行实验。
超棒!打造顶级智能体Claude Code的经验教训
Claude Code工程师Thariq文章受开发者盛赞,揭示打造智能体经验。提示词缓存是关键,要合理排列顺序;管理动态上下文需避免破坏缓存;为智能体选适配工具,随模型进化调整行动边界。
想入局VLA却不知从何下手?NTU&中大开源「终极菜谱」:从基座到频域建模,每一步都有实验支撑
MMLab@NTU联合中山大学的研究推出VLANeXt,从12个关键维度剖析VLA设计空间,每步有实验支撑。它在LIBERO及LIBERO - plus上超越SOTA方法,遇扰动成功率跃升10%,适合不同水平从业者。
GenEnv:智能体与环境模拟器之间的难度对齐协同进化 | 直播预约
训练高性能 LLM 智能体受限于真实世界交互数据的成本和特性,为此推出 GenEnv 框架,它建立难度对齐协同进化博弈,能让智能体表现提升,减少数据使用量,为扩展能力提供数据高效路径。
再造一个10亿爆款!Ins之父卸任Anthropic CPO,空降一线写代码
Anthropic高层大调整,Instagram之父Mike Krieger卸任CPO,转岗加入核心神秘部门Labs成技术团队成员。Anthropic扩展Labs团队,欲围绕Claude快速迭代产品,应对竞争。
极海正式发布GALT62120 12通道汽车高边LED驱动器
随着汽车智能化、个性化发展,高边LED驱动器需求增长。极海正式发布GALT62120 12通道汽车高边LED驱动器,支持12通道精密高边电流输出等,有独特创新设计,还提供开发工具与全栈式车灯解决方案。
智能体框架的选择:一文读懂9个主流AI智能体框架
文章深入探索截至2025年11月的9个主流AI智能体框架,阐述成熟AI框架核心要素,分析各框架优劣势、适用场景,助读者选适合团队和业务的框架。
刚刚,OpenAI发布首个AI浏览器ChatGPT Atlas!谷歌最怕的来了
OpenAI发布AI浏览器ChatGPT Atlas,原生嵌入ChatGPT,有侧边栏、浏览器记忆与智能体模式,可在页面内理解意图并完成任务。谷歌股价应声下挫,AI浏览器之战升温。