「基准测试成本」共找到 3377 篇相关文章
外行瞎写的Vibe Coding,都能并入Agent 工程了:最吓人的是,我们“摆烂”有正当理由了
本文编译了软件专家 Simon Willison 在播客的访谈内容。他指出 Vibe Coding 与 Agent 工程正走向融合,AI 写代码渐趋可靠,人类审查成开发瓶颈,还探讨了 AI 对编程的影响、算力成本博弈等问题。
小米MiMo-V2-Flash开源:3090亿参数大模型能否改写AI行业规则!
2025年12月16日小米开源旗舰大模型MiMo - V2 - Flash,参数3090亿。它有独创‘按需激活’机制,推理成本低。采用MIT协议,价格亲民,构建全栈开源矩阵,在编程、长文本处理等领域表现出色。
让大模型“吃一堑长一智”,南理工百度等提出模型记忆新方法
南京理工大学联合百度等提出新方法ViLoMem,构建视觉流+逻辑流的双流语义记忆,让模型“从错误中学习”。它能在多模态基准提升模型表现,强模型记忆还可迁移给小模型。
GPT-5.2已上线24小时:差评如潮!
OpenAI 十周年推出号称强大的 GPT - 5.2,却差评如潮。它在 SimpleBench 测试结果不佳,回答不稳定,编程和艺术创作效果差,情商低、不通人性,审查和安全拒绝机制也饱受诟病。
比Gemini 3记得更多,谷歌新框架将上下文记忆干到了200万!
Google在NeurlPS2025大会推出结合RNN与Transformer的全新架构Titans,能扩展到超200万个token上下文。背后涉及Titans和MIRAS两篇论文,共同推进测试时记忆概念,实验显示新架构性能出色。
解放军总医院联合南大、吉大等机构,共同提出首个「脊柱诊疗大模型」SpineGPT
解放军总医院联合多机构研发首个脊柱诊疗大模型 SpineGPT。研究指出通用 LVLM 有‘认知鸿沟’,团队构建 SpineMed 生态系统,含 SpineMed - 450K 数据集与 SpineBench 评估基准,SpineGPT 表现超越开源模型。
AI地理学家诞生:麻省理工、斯坦福用多智能体框架重塑地理空间建模,刷新SOTA
麻省理工、慕尼黑工大及斯坦福AI实验室发布GeoEvolve框架,深度融合地理知识与进化算法,实现复杂地理空间模型自动发现与优化。经实验验证,其性能超越以往基准,有望在多领域发挥作用。
实测谷歌AI故事书,我实现漫画和绘本自由了
谷歌Gemini推出免费StoryBook工具,30秒左右可生成10页故事书,支持中文且内容有趣。测试显示,它在图像风格、故事创作上表现出色,还能作学习和展示工具,获网友好评。
大模型智能体如何突破规模化应用瓶颈,核心在于Agentic ROI
上海交通大学联合中科大研究指出,大模型智能体规模化应用有瓶颈,核心在于Agentic ROI 未达实用门槛。研究提出其发展呈「之字形」,先规模提升信息质量,再轻量化降成本。
7.3K Star!用 Orca 组建 AI 舰队:让 Claude Code 和 Codex 同时开工!
Claude Code 大火后,多家大厂推出自家 Code CLI,多终端操作上下文切换成本高。Orca 是开源 AI 编排器,可让多个 AI 编程助手并行工作,集中查看结果,有并行工作区、统一管理界面等亮点。