「推理服务基础设施」共找到 2938 篇相关文章
听了Andrej Karpathy最新2小时访谈,我对Agent彻底祛魅了
Andrej Karpathy在播客中表示,Agent发展还需十年,离像实习生工作还差很远,要解决诸多能力问题;他认为强化学习糟糕但其他方法更糟,还提出AI应削减背书式记忆、未来强大AI或仅十亿参数等观点。
1万亿参数Ling-1T开源,国产LLM牛了~
Ling-1T是Ling 2.0系列首款旗舰“非思维”模型,总参数量达1万亿。预训练数据超20万亿token,支持128K上下文长度。在多项任务中表现出色,是目前已知最大的FP8训练基座模型,已完成全面评测。
“iFold”,苹果AI新成果
苹果发布基于流匹配的蛋白质折叠模型SimpleFold,被戏称“iFold”。它用通用Transformer模块搭配流匹配生成范式,3B参数版本追平谷歌AlphaFold2性能,还解决了传统模型算力依赖问题,效率高。
Vibe Coding两年盘点:Windsurf已死、Cursor估值百亿,AI Coding的下一步怎么走?
文章回顾2023年初到2025年中AI Coding发展,涉及Cursor、Codeium等产品轨迹。指出极端‘坏用户’使商业模式崩塌,需平衡‘交付质量’与‘token成本’,还提及‘Knowledge Suggestion’功能及目标用户选择。
科研智能体「漫游指南」—助你构建领域专属科研智能体
该综述提供科研智能体构建指南,提出三级分级系统,阐述构建流程与能力增强方法,涵盖知识组织、注入、工具集成,还提及基准评估和未来研究方向,促进AI与自然科学融合。
OpenAI和Anthropic罕见互评模型:Claude幻觉明显要低
OpenAI和Anthropic罕见合作,互相授予API权限评估模型安全与对齐情况并发布报告。双方派出多模型参与,从指令层次、越狱、幻觉、欺骗策略等方面评测,呈现各模型优缺点。
一场「狼人杀」,考倒了一堆大模型
南开大学等机构设计 InMind 评测框架,在 Avalon 游戏对 11 个前沿大模型测试。多数模型停留在表层模仿,仅少数推理增强模型有初步‘风格敏感性’,未来人机交互应关注‘像不像’。
Pinterest 在迁移到 Kubernetes 的过程中发现了罕见的搜索失败
Pinterest 工程师披露将搜索基础设施迁移到 Kubernetes 时遇‘百万分之一’故障调试过程。故障由容器化组件与遗留设施过渡时细微不一致触发,该事件凸显云原生迁移挑战及调试价值。
马斯克:Grok 5 将实现真正的 AGI
Vending Bench测试中,xAI的Grok 4以近两倍销售量和31%高收益击败GPT - 5,展现惊人稳定性。马斯克却称Grok 5有机会成真正AGI,引发网友各种反应,Grok 4虽领先但也有争议。
2025 WAIC落幕,深谋科技异军突起,以技术与落地破局具身智能赛道
2025 WAIC落幕,深谋科技作为精英合作伙伴首次亮相,未随波逐流,而是切入脑控、动态视觉伺服和康养场景三大底层能力领域,开拓创新赛道。其产品已商用部署,吸引众多媒体关注。