「物理基准测试」共找到 2450 篇相关文章
Thinking Machines 发布 Tinker API,实现灵活的模型微调
Thinking Machines公司发布Tinker API用于开放权重语言模型微调,可减少开发者基础设施开销。支持多种模型架构,集成LoRA,还发布开源存储库。虽有竞品,但Tinker侧重暴露低级原语,尚处封闭测试。
一举击败Claude Code!微软提出代码生成黑科技:一键直出36K行代码
现有方法依赖自然语言规划生成仓库易失效,微软提出Repository Planning Graph (RPG),以图谱替代文字规划。基于此的ZeroRepo框架能让仓库生成可控、可扩、可验证,在新基准RepoCraft上表现远超Claude Code。
ICML 2025 Spotlight | 快手、南开联合提出模块化双工注意力机制,显著提升多模态大模型情感理解能力!
情智兼备是人工智能发展方向,但多模态情感数据语义复杂,建模跨模态关联是挑战。快手可灵团队与南开提出模块化双工注意力范式,构建‘摩达’模型,在多任务测试中性能提升,成果被 ICML 2025 收录。
Fable第一,谁第二?Anthropic钦点8款模型名单曝光
Anthropic官宣Claude Fable 5全球上线,公布安全测试结果,8款模型包括中国的Kimi K2.7。北美公司也用行动认可中国模型,Kimi在多方面表现出色,其商业模式类似Anthropic,未来潜力大。
codex降智大bug找到了,一句话让它把智商找回来!
近日Codex被降智,网友监测其智商曲线下降。L站大佬发现大bug及解法,在全局agents.md加特定语句,可让它大幅恢复智商。测试显示,加语句后正确率提升,降智概率降低。
全景视觉的Depth Anything来了!Insta360推出DAP,200万数据打造全场景360°空间智能新高度
Insta360等团队推出全景度量深度基础模型DAP,构建200万量级全景数据引擎,设计三阶段伪标签管线,在模型架构上也有创新,在多项测试中效果优异,项目代码与模型已开源。
DeepSeek V3.1 Base突袭上线!击败Claude 4编程爆表,全网在蹲R2和V4
昨晚,DeepSeek官方悄然上线全新V3.1版本,上下文长度拓展到128k,参数685B,支持多种精度格式。其编程能力突出,在Aider测试中霸榜,性能超越Claude Opus 4,还有成本低等优势。
重磅!OpenAI深夜发布GPT-6 Astra,总裁Brockman:这就是AGI
OpenAI发布GPT-6 Astra,总裁称实现了AGI。它在多基准测试成绩优异,能独立完成复杂工作,网络安全能力强。但推理难监控,其即日起向特定机构开放,有使用价格标准。
ICML 2026|告别「单线程」思维,智能体进化出了原生的并行推理大脑
北京通用人工智能研究院语言交互实验室提出原生并行推理器NPR,它有「自蒸馏 + 并行强化学习」三阶段训练范式,配套并行推理引擎,让并行推理成模型原生认知能力,还介绍了其具体实现、实验结论等。
本周 5 个实用的 Github 开源项目,真香!
文章介绍本周5个实用Github开源项目。有资源聚合媒体中心stremio-web,AI原生安全测试平台CyberStrikeAI,本地优先AI编程远控工具hapi,智能股票分析系统daily_stock_analysis,纯前端JavaScript GUI智能体框架PageAgent。