「实测」共找到 449 篇相关文章
推荐两个Vibe Coding必备的skill,Vibe程序员效率起飞了
Vibe程序员应聚焦创意,提高效率很关键。文章推荐两个实用技能,一是codebase - to - course,助开发者理解代码库;二是app - store - screenshots,可快速生成应用商店图,都经作者实测。
本地/云电脑双模式,豆包来了!
黄叔实测豆包「工作任务」模式,其有独特的本地/云电脑双模式。本地能分析电脑内存问题,云端可处理监控任务,还能助力开发复杂项目,且Skill自动接入,与本地电脑实时同步。
Claude Code狂删80%提示词,Opus 5反手加回去了
Anthropic宣布删掉Opus 5等模型超80%系统提示词,因早期提示词规则多易冲突。但网友实测Opus 5比Opus 4.8提示词加长72%,新增内容用于约束模型主动行为。
Sand.ai开源发布MagiCompiler:突破局部编译界限,定义训推性能上限
大模型开发者面临速度与显存的两难选择,原生torch.compile有局限。Sand.ai开源MagiCompiler,突破传统编译界限,提出Compiler as Manager理念,解决算力与显存墙难题,性能实测亮眼,且接入简单。
测完阿里的Accio Work,我理解了「一人跨国公司」为什么可能
作者体验阿里Accio Work后认为,它作为面向全球中小企业和创业者的企业级Agent,像出厂就懂做生意的团队,能让电商小白从零搭Shopify店,通用Agent难以做到,体现数据和场景壁垒。
AI编程新王Claude 4,深夜震撼登基!连续编码7小时,开发者惊掉下巴
Anthropic发布全球最强编程模型Claude 4,含Opus 4和Sonnet 4。Opus 4是顶尖编码模型,Sonnet 4是Sonnet 3.7的重大升级。还发布系列产品,Claude 4定价与此前一致,部分用户可体验。
RSI离我们有多远?这家中国团队给出了第一梯队的工程解
目前行业探讨大模型的RSI时,常陷入思维定势。EvoMap团队没有盲目跟风,而是提出极具现实意义的工程新路径,构建自进化智能体,让经验在网络流转,还以硬核数据证明其体系有效性。
我的一人公司,空降腾讯一键开雇!
作者分享一人公司借助腾讯WorkBuddy升级,自建数据分析、编辑部,外聘软件工坊等团队,AI当同事,0元年薪24小时在线,解决一人难扛多事问题,还介绍使用方法。
Ψ₀刚刚开源了!迈向通用人形机器人的基座模型
南加州大学团队开源迈向通用人形机器人的基座模型Ψ₀,仅需80条真机遥操作数据,在总体任务成功率和子任务指标上平均领先NVIDIA最新开源模型GR00T N1.6超40%,还介绍了其数据、训练、架构等方面。
新玩法!Karpathy周末手搓“大模型智囊团”应用:各大LLM同台互评,代码已开源
Andrej Karpathy周末手搓Web应用llm - council,让多个大模型像顾问般提供建议。查询通过OpenRouter分发给多个大模型,它们互评后由‘大模型主席’生成最终回复,代码已开源。