「代码能力评测」共找到 4860 篇相关文章
我用“悟空”做了应聘和OPT Skills,预测上班和创业成功率丨龙虾OPT创业笔记
钉钉发布全球首个企业级 Agent 平台“悟空”,它是AI产品进入下一个时代的探索,能接入多平台真实数据,操作公司流程。通过开发者应聘、跨境电商、知识博主等场景案例,展现其能力,还能预测创业成功率,解决企业使用AI的安全痛点。
昆仑万维开源的SkyReels-V3,把马斯克请来带货了
1月29日,Skywork AI团队宣布开源SkyReels - V3多模态视频生成模型系列,涵盖三大核心能力,达业界领先。经测试表现出色,其技术有创新,且模块化设计适配性强。昆仑万维此前在视频生成领域迭代快,此次开源或加剧竞争。
【闭门会干货】字节 AI 最新动态:豆包升级+提示词神器+ SOTA 向量模型 + AI知识库 !
作者参加字节火山方舟开发者闭门会,分享诸多AI成果。豆包模型0715版较0615版能力提升显著;PromptPilot工具让提示词优化工程化;还有Responses API、AI知识库等实用工具,且有免费计划。此外,Seed1.6 - Embedding登顶多榜单SOTA,VikingDB升级,平台有协作奖励计划。
关于CUTLASS Grouped GEMM中Alignment参数的分析
文章围绕CUTLASS Grouped GEMM的Alignment参数展开。介绍其含义与自然对齐有关,既代表访问粒度也指明地址对齐要求。针对CUTLASS 2.x和3.x API分别阐述设置Alignment的方法及原理,还给出编译期推导代码示例。
把 Gemini 和 GPT 放到《我的世界》当教练,谁能看懂机器人的微操?
国立清华与英伟达团队研究《VLM-AR3L》,把Gemini 2.0、GPT-4.1等拉进考场,评估视觉裁决能力。结果显示Gemini综合最稳,开源小模型特定场景反超。还提出VLM-AR3L框架破使用瓶颈,实战超人类手写奖励。
刚刚,神话级Fable 5.1来了!
今天,Claude Fable 5.1全平台上线,Mythos 5.1专供特定团队。新模型跑分有断层式代差,还降低了算力门槛。通过重绘金星、设计蛋白等案例展示其科研能力,在编程上也表现出色,同时在安全上采取‘一松一紧’策略。
拒绝视频生成,深度跃迁提出具身基座模型全新路线
深度跃迁发布世界动作模型 DELE - w0.5,放弃基于视频生成模型的路线,训练时联合学习动作与未来世界表征,推理时移除该表征分支。在真机实验中表现超基线,具跨背景泛化能力,为世界模型提供新思路。
Stripe 发布基准测试:AI 智能体可开发集成方案,但校验环节存在短板
Stripe推出基准测试套件,评估AI智能体构建完整Stripe集成方案的能力,测试聚焦金融系统贴近生产环境的集成场景。测试显示,不同任务类型评测结果差异显著,核心瓶颈在于验证环节,当前智能体短板在校验逻辑等方面。
接入 MiniMax M2.7 后,我的 OpenClaw「超进化」了
作者实测 MiniMax 新模型 M2.7,其在基准测试、代码能力、多智能体协作等方面表现出色。接入 OpenClaw 后,能高效完成复杂任务。M2.7 指令遵循率高、长上下文处理能力强且价格低,有望提升 Agent 生态表现。
3D重建的惊人进展:多所世界名校联合发布论文,告诉你AI在3D世界的研究现状
多所世界名校联合发布调查研究论文,回顾用于3D重建和视图合成的前馈技术并分类,研究关键任务及应用。前馈模型打破每场景优化魔咒,带来速度和泛化能力的提升,解锁新应用,但也面临挑战。