零样本设计」共找到 1735 篇相关文章

开源动态8

在AK大神爆火的任务里,摸清国产AI真实水平

4月20日深夜Kimi K2.6发布并开源,作者借Andrej Karpathy的AI Wiki思路设计高承压任务,测试其Agent底层能力,考察它在单Agent、Agent网站和Agent Swarm三种模式下表现,探究国产AI真实水平。

InfoQ
产品应用8

97年金融男带8只「电商龙虾」全球开店!2个月后同行慌了

阿里版「电商龙虾」Accio Work打通国际站,一个工作台可全包选品、发品等七个岗位的活。它结合多维度数据助力选品,还能进行广告诊断、店铺运营等,在不同商家案例中成效显著。

新智元
开源动态8

清华开源|做一门课要3天?用 OpenMAIC,30分钟生成完整互动课堂|GitHub 15.6k

OpenMAIC 是清华开源的 AI 互动课堂平台,能将主题或学习材料快速转化为完整互动学习体验。它把课堂拆成多种交互组件,架构设计出色,支持多 LLM 服务商,还能在聊天应用生成课堂。

小华同学ai
产品应用8

单张显卡跑出15倍推理速度,aiX-apply-4B小模型加速企业AI研发落地

3月25日,硅心科技发布专为代码变更应用场景设计的轻量级模型aiX - apply - 4B。该模型在准确率、推理速度等方面表现出色,超越部分千亿级大模型,还推出“大模型+小模型”协同架构释放企业算力价值。

量子位
新闻资讯8

陶哲轩:AI 正在让“想法”变得廉价,而真正的瓶颈从未改变

数学家陶哲轩与Dwarkesh Patel访谈,探讨AI在科学发现中的作用。他指出AI让‘想法生成’成本降为,验证想法成新瓶颈;AI擅长广度,人类擅长深度;AI负责找证明,人类提炼‘理解’与‘智慧’。

力学与人工智能
产品应用7

OpenClaw 火了半年,Agent 执行层依然是工程空白

当前主流 Agent 工具链执行层基本空白,Violoop 是少数在执行层做系统化设计的项目。它是桌边触屏硬件,获取三类运行时数据,具备感知 - 判断 - 执行运行时,有多种核心能力,适合特定场景团队评估。

AI工程化
开源动态8

如何定义“人味儿”?——HeartBench评测体系建设实践

在大模型竞争格局生变,情感智能评测缺失的背景下,作者团队发布聚焦AI拟人化的中文评测体系HeartBench,介绍其设计、评估方式、迭代过程等,还沉淀了评测体系构建方法论及专家标注管理思考。

阿里云开发者
算法论文8

复旦北大联合美团LongCat提出TDAR:用“粗思考,细求证”破解Block Diffusion的速度精度悖论

复旦大学、北京大学联合美团LongCat提出Block Diffusion推理模型Test-Time Scaling新框架TDAR,引入‘粗思考,细求证’范式与有界自适应置信度解码,打破速度与精度和博弈,在多基准测试表现出色。

机器之心
新闻资讯8

魔法原子,105亿瞄准具身智能终局

2026 年很多行业被 AI 重塑,具身智能赛道尤为明显。魔法原子推动生态基金布局,撬动超 105 亿资金,完成 5 亿融资。它推进多维度‘连接能力’,构建系统能力与落地场景,成资本与行业关注样本

量子位
开源动态8

OpenClaw 深度解析:一只龙虾凭什么震撼全世界

万字长文深度解析OpenClaw,阐述其核心原理、创新亮点以及对AI行业的深远影响。解读为何大厂难以打造类似产品,剖析简单任务实现困难的根源,还探讨了其设计机制、应用场景、潜在问题及应对策略。

AI科技评论