测试方法」共找到 3042 篇相关文章

新闻资讯7

新榜单CompileBench:让AI能搞定22年前的老代码

近日,CompileBench 测试 19 个 AI 模型编译真实代码能力,最难任务是复活 2003 年代码并交叉编译到 Windows 和 ARM64。不同模型表现不同,如 Claude Opus 4.1 成功完成 ARM64 静态编译,各模型有不同优缺点。

AI工程化
算法论文8

自搜索强化学习SSRL:Agentic RL的Sim2Real时刻

本文由多机构联合完成,引入自搜索强化学习SSRL。它利用结构化prompt和format reward提取模型world knowledge,降低幻觉。还探索Sim2Real有效性,验证SSRL训练模型在真实场景泛化性,且所有训练数据等已开源。

机器之心
开源动态8

腾讯开源WMT2025冠军大模型:拿下30个第一,同类最佳

昨晚腾讯开源WMT2025冠军翻译大模型Hunyuan - MT - 7B,它在31种语言测试中获30个第一,成同类最佳。文中介绍其架构、训练过程,还通过多场景翻译案例展现优势,有望推动高质量翻译普及。

AIGC开放社区
新闻资讯7

波士顿动力机器狗侧空翻炸场!穿轮滑鞋照样能翻

风头被中国机器人盖过的波士顿动力,让机器狗Spot完成侧空翻等动作。工程师称它并非为空翻设计。空翻是严苛测试手段,能验证系统性能,还透露了训练细节,此外它还将上《美国达人秀》。

量子位
开源动态8

腾讯AI Lab开源可复现的深度研究智能体,最大限度降低外部依赖

腾讯AI Lab推出全开源智能体框架Cognitive Kernel - Pro,解决现有开源框架依赖付费工具问题。它有模块化架构等核心设计,创新训练方法,在多任务中表现出色,降低外部依赖,相关论文登HuggingFace热榜。

量子位
产品应用7

Jina Embeddings v4 的量化感知训练

文章聚焦Jina Embeddings v4的量化感知训练。介绍量化技术可压缩向量体积、提升检索效率,对比四种主流量化方法,重点实验PTQ和Output QAT,还测试非对称量化,给出实验结果与结论。

Jina AI
新闻资讯8

韦东奕论文登数学顶刊,将散焦方程的爆破性研究扩展至d≥4

韦东奕和北大学者章志飞、邵锋合作的论文发表于数学顶刊《Forum of Mathematics, Pi》。他们将散焦方程的爆破性研究扩展至d≥4,成果填补空白,证明方法可推广到其他方程。

量子位
算法论文8

从「记忆解题」到「深度推理」:港科大推出首个本科数学动态评测基准 UGMathBench

港科大团队发表在 ICLR 2025 的研究 UGMathBench,是首个本科数学动态评测体系。它涵盖 16 个学科领域,通过变量扰动创建多版本试题,引入创新指标评估模型推理能力,测试结果揭示了当前模型短板。

AI科技大本营
算法论文8

统一架构新思考,北大团队UniWorld-V1统一大模型

北大袁粒课题组提出统一大模型架构UniWorld-V1。通过对GPT - 4o - Image实验,发现其依赖语义编码器提取视觉特征,据此设计架构,在多基准测试表现优异,开源代码等促进研究。

AI寒武纪
新闻资讯8

AI生图大洗牌!流匹配架构颠覆传统,一个模型同时接受文本和图像输入

AI生图有新突破,新模型FLUX.1 Kontext用流匹配架构,与此前技术不同,能接受文本和图像输入。其来自Black Forest Labs,有编辑和生成能力,还具备4个特性,第三方测试也给出提示词使用技巧。

量子位