「代码能力评测」共找到 4810 篇相关文章
1600代码造出水下曼哈顿, Fable 5让Karpathy看呆了
Fable 5重新上线,Arena.ai的Gostev用其生成63个3D世界,多数一次成型,连Karpathy都直呼没想到。1600行代码就能撑起水下曼哈顿,还能将世界名画变成可穿行的3D世界,但游戏是其弱项。
设计师的 ChatGPT 时刻:Figma 这次把“设计即代码”玩成现实
文章介绍了AI编程产品分类,指出Vibe Coding存在的问题。重点讲述Figma在2025 Config发布Vibe Coding产品Figma Make,其可从设计稿生成网页,有编辑工具精准迭代等功能,还推出可视化低代码建设工具Figma Site。
LeRobot v0.4.0 正式发布:全面提升开源机器人的学习能力
LeRobot v0.4.0 正式发布,带来多方面重大升级。有可扩展的 Datasets v3.0、新 VLA 模型、全新插件系统;支持 LIBERO 和 Meta - World 仿真;还有数据处理 Pipeline、多 GPU 训练简化等特性,上线了机器人学习课程。
Anthropic 估值 3800 亿,增长营销只有 1 个人,还不会写代码
Anthropic估值3800亿美元,增长营销团队仅一人。该负责人用Claude Code搭建自动化工作流,完成传统团队多人的活。不止营销部门,其他部门也用它提效,反映OPC趋势。
编程进入「对讲机」时代!Claude抢发语音写代码,转录Token全免费
Anthropic给Claude Code加语音模式,输入 /voice,长按空格说话即可输入,转录Token全免。OpenAI的Codex也更新类似功能。语音编程在Debug、架构讨论等场景好用,但识别变量名等仍有短板,未来编程将多模态。
准确率轻松翻倍!不烧钱微调,AI靠“写日记”实现能力跃升
Memento - Skills系统抛弃大量算力微调模型参数的方式,靠读写反思、“写日记”式学习机制,在不改变模型参数下实现能力跃升,在GAIA和HLE基准实验中准确率显著提高。
Seedream 4.0大战Nano Banana、GPT-4o?EdiVal-Agent 终结图像编辑评测
在AIGC下一阶段,图像编辑成检验多模态模型关键场景。研究者提出EdiVal - Agent评估框架,能自动化生成指令并多维度评估编辑结果,其评估与人类判断一致性高,还对比了13个模型的多轮编辑表现。
实测 Seed 2.1:豆包基模超进化,国产模型能力跨过质变点
作者在做面向 Agent 项目时,因 Claude Code 内存开销大,需更轻方案。火山引擎 Force 大会发布 Seed - 2.1,作者实测其在办公、编程、图像理解等方面表现出色,认为它跨越质变点,将赋能国内 AI 生态圈。
爆火!几天狂揽5万星,这个神器让AI一次砍掉54%屎山代码
最近开源项目Ponytail爆火,几天揽5万星。它将老程序员‘偷懒智慧’系统化喂给AI,让AI编码代理思考,使代码量直降54%,最高砍到94%,成本和时间同步下降,还保持100%安全。
CVPR 2025 | 多模态统一学习新范式来了,数据、模型、代码全部开源
中国人民大学、清华和腾讯合作的CVPR 2025论文指出,当前多模态学习范式有缺陷。为此提出新范式,构建AV - UIE数据集、Crab框架,实现任务互助,在多任务上超垂类专家模型,数据、模型、代码开源。