测试技术」共找到 4364 篇相关文章

开源动态8

四大顶尖模型对决!6000 字测评带你看Deepseek R1有多强

昨天 Deepseek-R1 0528 正式开源,作者让它与 Claude Opus 4、Sonnet 4、Gemini 2.5 Pro 在六个前端开发任务中对决。结果显示,Deepseek-R1 在多数测试表现出色,且价格优势明显。

歸藏的AI工具箱
推荐文章8

提示工程实战指南:从Zero-Shot到Graph Prompting,7大核心技术全解析

随着大型语言模型发展,提示工程成关键技能。文章介绍零样本提示、少样本提示等七种提示优化模式,分析适用场景、优缺点,还给出示例,最后总结各技术适用场景及最佳实践。

OpenMMLab
算法论文7

正确答案 ≠ 正确推理,CoT 或成大模型推理能力停滞的「罪魁祸首」?

研究指出当前大模型推理能力评估多关注答案准确性,忽视推理步骤。通过对前沿模型测试发现,2023 - 2024 年大模型推理能力提升停滞,进步靠提示工程,自底向上策略最有效。

AI科技评论
推荐文章7

详细介绍!RAG 和 GraphRAG:了解何时(When)、如何(How)使用它们

文章详细介绍传统RAG和GraphRAG技术,前者通过向量搜索检索上下文,但无法体现数据关系;后者用知识图谱提升检索效果,亮点是构建图谱、整合信息。还指出两者优缺点,建议结合使用。

AINLPer
新闻资讯7

印度国家级大模型上线两天仅 300 余次下载,投资人直呼“尴尬”:韩国大学生模型都有20万!

印度 Sarvam AI 发布国家级模型 Sarvam - M,虽被赞为本土 AI 突破,支持 10 种本地语言,但上线两天仅 334 次下载,投资人批其成绩尴尬,还与韩国大学生模型对比,引发社区争论。

AI前线
新闻资讯7

AI开源狂飙,OpenAI们慌了!GenAI大洗牌,2025趋势深度解读

2025年,ChatGPT仍领跑,但DeepSeek、Qwen等开源模型加速追赶。独立机构报告总结六大趋势,涵盖技术突破与市场格局演变,如推理模型实用化、MoE架构普及等,开源势力挑战闭源巨头。

新智元
新闻资讯8

刚刚,OpenAI开放GPT-4.1,100万上下文、代码能力超强

今天凌晨1点30,OpenAI宣布开放GPT - 4.1,可在ChatGPT中使用。它针对编码任务,支持100万tokens上下文,在多项测试中表现优于前代,价格更优,不同用户将陆续获得使用权限。

AIGC开放社区
新闻资讯7

6个月估值翻倍!黄仁勋力荐的AI搜索公司欲开发浏览器取代谷歌Chrome

AI搜索引擎公司Perplexity接近完成5亿美元融资,估值达140亿美元。其搜索引擎产品出圈,获黄仁勋力荐。该公司欲开发AI浏览器Comet取代Chrome,不过面临谷歌等多方竞争。

量子位
新闻资讯7

Claude1.7万字系统提示词全网刷屏!Karpathy锐评:LLM训练缺乏关键范式

Claude近1.7万字系统提示词在GitHub泄露,网友称是提示技术的金矿。大神卡帕西提出系统提示学习新范式,模拟人类经验积累,让LLM有‘记忆’功能,引发网友激烈讨论。

量子位
产品应用7

“光靠人盯不住了”!拆解上万张晶圆,这家公司靠 AI 将芯片良率提升数个百分点

喆塔科技创始人赵文政看好半导体软件领域引入AI技术。喆塔将DeepSeek接入自研模型,应用机器学习算法提升半导体企业良率,构建智能生态系统,产品获客户认可,未来将加大研发投入。

InfoQ