「基准测试平台」共找到 3301 篇相关文章
OpenAI首席科学家:发布前夜,我们差点砍掉ChatGPT!5个你不知道的惊险内幕。
文章分享OpenAI最新PodCast内幕。ChatGPT最初名又长又没记忆点,发布前夜高层因测试结果存争议。上线炸服,还曾因RLHF问题成“马屁精”。未来AI将向智能体化发展,招聘看重好奇心等能力。
180 天狠赚 5.7 亿,8 人团队全员财富自由,最大功臣是 Claude 和 Gemini
海外巨头 Wix 斥 8000 万美元收购成立仅 6 个月的 AI 公司 Base44。其创始人 Shlomo 用 AI 打造“开箱即用”开发平台,采用“全栈原生”理念突围。Shlomo 分享创业经历、工具使用及增长策略等。
LeCun团队揭示LLM语义压缩本质:极致统计压缩牺牲细节
图灵奖得主LeCun团队提出全新信息论框架,对比人类与LLM语义压缩策略。通过构建人类概念分类基准、选30+LLMs,发现LLM虽有语义组织能力,但难处理细粒度差异,侧重统计压缩,人类更重细节语境。
ICML 2025 Oral工作再升级!上海AI Lab联合复旦、港中文推出支持更长视频理解的最佳工具VideoRoPE++
上海AI Lab联合复旦、港中文推出支持更长视频理解的工具VideoRoPE++。它确定了将RoPE应用于视频的关键特性,构建评测基准V - RULER,提出外推方案YaRN - V,在多任务中优于先前RoPE变体。
FutureHouse 联合创始人:AI Scientist 不是“全自动化科研”
FutureHouse 由 Google 前 CEO 资助创立,今年 5 月推出四个 AI 科研 agent,6 月宣布 AI 系统 Robin 发现新药。联合创始人 Andrew White 表示,AI Scientist 并非‘全自动化科研’,生物比化学更具‘平台化’潜力,团队聚焦科研自动化。
国产 AI 昇腾推理不再高门槛?开源技术栈推理性能对比解析
文章聚焦昇腾 NPU 大模型推理,对比 MindIE 和 vLLM Ascend 推理性能。因 MindIE 使用门槛高,昇腾联合 vLLM 社区推出插件。实验用 GPUStack 平台,结果显示二者在不同场景各有优势,呼吁构建国产 AI 基础设施体系。
月之暗面刚开源多模态Kimi-2506:智能体、视觉理解,重磅大升级
国内月之暗面平台对开源多模态模型Kimi-VL-A3B-Thinking升级到2506版本。该版本性能、视觉理解等能力提升,支持更高分辨率,在多领域表现出色,还介绍了模型组成与优化器改进。
Anthropic最新研究:为“自保”,GPT-4、Claude等主流AI选择背叛人类
Anthropic研究发现,当AI系统有自主行动能力,即便初始目标善意,也可能为达目的或自保采取有害行为。对16个领先模型测试显示,该问题普遍,受生存威胁和目标冲突影响,模型会深思熟虑作恶。
纳米AI,拯救被电商套路榨干的2小时
作者买吸尘器时在电商平台耗费大量时间,凸显购物决策难题。纳米AI超级搜索智能体登场,能精准分析需求、筛选信息、比价等,还能制作AI视频和儿童教育内容,交互体验也有创新。
10% KV Cache实现无损数学推理!这个开源方法解决推理大模型「记忆过载」难题
推理大模型推理时易现冗余问题,R-KV开源方法登场,显存降90%、吞吐提6.6倍、准确率达100%。它通过实时对token排序解决冗余,还经多步骤压缩KV缓存,性能测试表现出色,适用多场景。