代码评估」共找到 2293 篇相关文章

开源动态8

面向长时语音与声音克隆的全模态开源万能聊天机器人MGM-Omni

文章介绍了全模态开源聊天机器人MGM - Omni,它基于MiniGemini,支持多模态输入输出,具备长语音理解、生成、流式生成、零样本语音克隆等特性,还给出安装、使用方法,展示评估结果。

GitHubStore
算法论文8

拒绝不必要Think:微软&北大提出第一种自适应大型混合推理模型

大型推理模型冗长思考开销大,微软研究院和北大提出大型混合推理模型(LHRMs),它能依查询上下文决定是否思考。介绍了两阶段训练流程、评估指标,实验显示其超越现有模型且效率高。

PaperAgent
新闻资讯7

2025科技圈最新职位:“Vibe Coding擦屁股工程师”,专治老板们的决策性Bug

生成式AI兴起后,科技公司CEO用其取代员工致大量裁员。但“氛围编程”效果不佳,AI生成代码常需修复,“氛围编程清理专家”应运而生,市场需求或不断增长,不过网友对此看法不一。

AI前线
产品应用7

AI 编码圈新卷王 Magic Path 来了,Claude Engineer 团队出品,号称UI设计的 Cursor 时刻。

Magic Path是Claude Engineer团队推出的AI驱动UI设计工具,非开源但有免费额度。它AI先行,能按提示词生成组件和React代码,亮点诸多,上手体验佳,生成UI可用,还有页面串联等功能,虽有不足但潜力大。

AI进修生
新闻资讯8

刚刚,Anthropic官方Cluade 5使用指南发布

Anthropic发布Claude 5的Context Engineering官方指南,指出为Claude Opus 5和Claude Fable 5删掉Claude Code超80%的system prompt,在编码评估上无明显损失。还揭示6组范式反转及四类上下文载体新分工。

PaperAgent
开源动态8

本地运行、支持视觉与工具调用:Meta 开源智能体模型

Meta AI Research 推出 300 亿参数的开放权重模型 Muse Glimmer,采用 Apache 2.0 许可证。它专为本地工作流设计,能在消费级硬件运行,经多项优化,在基准评估中表现出色,还支持多种框架。

AI前线
产品应用8

Seedance 2.0之后,又一中国视频模型SkyReels-V4登上全球第二

昆仑天工发布SkyReels V4视频大模型,在Artificial Analysis Arena基准测试中排全球第二。它支持多模态输入、音视频同步生成等,采用独特架构与技术,经多阶段训练,有全新评估基准,表现出色。

AIGC开放社区
算法论文8

6款小游戏难倒所有顶级VLM!愤怒的小鸟让它们全军覆没,性能不如随机猜测

淘天集团未来生活实验室提出首个系统性评估多模态大模型(VLM)交互式物理推理能力的综合基准DeepPHY。它集成六个物理环境,对17个主流VLM测试,揭示其在物理交互等方面短板。

量子位
新闻资讯7

AI 编码让资深程序员“掉速”19%!OpenAI 前研究员实锤:别再交“AI 工具智商税”了,谷歌大佬力挺!

METR研究显示,AI编码工具让开发者效率降19%,与主观感受及专家预估相反。此结果引发热议,谷歌技术大佬支持,指出AI工具生成代码难达标准,未来或改进,目前更适合小规模项目。

InfoQ
新闻资讯7

The Batch:836 | 基准测试成本攀升

独立AI测试实验室披露评估推理模型成本上升。这些模型生成“思维链”提升输出质量,但计算需求增加,成本上升使资源有限组织难复现结果,且新模型定价、按需分配推理token也让成本更复杂。

DeeplearningAI