「测试全流程」共找到 3925 篇相关文章
真够卷的!DeepSeek更完智谱更:GLM-4.6,代码国内最强
前脚DeepSeek更新到V3.2,智谱又推出GLM-4.6,代码能力达国内最强。测试显示其在多方面表现出色,还降低平均token消耗。寒武纪、摩尔线程跟进适配,价格也降低。
百度Qianfan-VL开源,纯国产自研昆仑芯跑出世界一流
百度开源全新视觉理解模型Qianfan-VL,有3B、8B和70B三个版本,在昆仑芯P800芯片上训练。该模型多模态能力强,OCR和教育场景表现突出,跑分超国际主流模型。芯片功耗低、架构优,模型训练方法创新。
阿里的未来,是通往超级人工智能
云栖大会上,阿里巴巴 CEO 吴泳铭演讲传达阿里对 AI 发展判断与战略规划。他认为 AGI 非终点,ASI 是目标,并提出实现三阶段。还指出阿里抓住大模型和 AI Cloud 支点,要把通义千问打造成 AI 时代 Android 系统。
比思维链准43%!逻辑脑+大模型直觉,推理可靠性大幅提升
中德研究团队发布成果,给大模型外挂「逻辑脑」,结合答案集编程与LLM,构建神经 - 符号框架,提升空间推理准确率,让AI能说清逻辑、跨任务迁移,迈向更可靠的通用推理。
一个让 AI 智能体(AI Agent)工作更出色的绝妙方法,简单到令人惊讶:只要给它们设定一个人格
论文揭示无需复杂重新训练就能引导AI行为,提出MBTI-in-Thoughts框架,在提示词里让大语言模型扮演特定MBTI人格,其行为会改变,还经测试验证,有广泛应用前景。
登顶多模态推理榜MMMU!UCSD新方法超越GPT-5、Gemini
加州大学圣地亚哥分校团队开发的DreamPRM-1.5在MMMU测评榜夺冠,超越GPT-5、Gemini 2.5 Pro Deep-Think。它细化加权粒度到样本,有Instance Table和Instance Net架构,采用双层优化与生成式奖励模型。
时隔多年,AI芯片又是华为发布会主角了
华为全联接大会上,轮值董事长徐直军带来全球最强算力超节点和集群。公布昇腾、鲲鹏芯片未来2年演进规划,还开创灵衢互联协议。虽单芯片受限,但集群层面有望实现超越。
GPT-5都救不了的AI幻觉,原来问题不在模型,在“考卷”
OpenAI研究指出AI产生幻觉的根本原因是评估和激励机制有问题。现有训练和评估流程奖励‘猜测’,导致模型易产生幻觉。研究还给出解决方案,要更新‘考试规则’,让模型适当表达不确定。
邱锡鹏老师团队发布VehicleWorld:让智能汽车真“智能”
邱锡鹏老师团队发布论文,构建高度仿真的智能座舱虚拟环境VehicleWorld,并提出基于状态的函数调用(SFC)方法。实验显示,SFC大幅提升任务执行准确率和效率,还构建了Vehicle Benchmark进行评估。
下一代数据中心和高性能计算OIO光互连技术方案!
文章深度解析OIO芯片级光互连技术、挑战与未来。传统电I/O技术有性能受限等问题,OIO能解决大容量芯片I/O扇出难题,是光电融合终极形态。它虽面临量产挑战,但前景好,全球产业力量已集结。