「写任务」共找到 2545 篇相关文章
隐藏超多上下文工程(Context Engineering)技巧的框架,来试一试吧!
文章指出多数人构建的AI Agent像Shallow Agent,处理复杂任务能力弱。以Claude Code等为例,介绍深度Agent架构的秘密,如冗长提示词、规划工具等,还推出开源包deepagents方便上手。
WAIC 2025大黑马,一个「谢耳朵AI」如何用分子式超越Grok-4
当Grok - 4讲冷笑话时,中国科学家用书生Intern - S1破解癌症药物靶点密码。7月26日上海AI实验室发布并开源Intern - S1,多模态能力全球开源第一,相关平台也上线,有望重构科研生产力。
我花12小时深度实测,阿里Qwen-3 Coder被Kimi K2“吊打”!
作者花12小时在真实项目中实测阿里Qwen - 3 Coder和Kimi K2。结果显示,Kimi K2在任务成功率、指令遵循、Bug修复、代码重构等方面全面领先,成本还更低,作者更推荐Kimi K2用于代码开发。
刚刚,OpenAI 发布了GPT-5 前菜:ChatGPT Agent
OpenAI发布ChatGPT Agent,它是统一智能代理系统,融合多种功能与工具,能动态选处理路径。在多测试中表现佳,采用强化学习微调新架构。使用体验似与人协作,OpenAI采取安全措施,还探索商业、分批开放,业内看法不一。
Kimi K2发布两天即“封神”?80%成本优势追平Claude 4、打趴“全球最强AI”,架构与DeepSeek相似!
国内独角兽月之暗面发布并开源 Kimi K2 模型,推出两天就在 OpenRouter 平台 token 使用量超 xAI 的 Grok 4。它成本低、性能强,编码能力追平 Claude 4,架构与 DeepSeek 相似,技术研究也多次‘撞车’。
ICML 2025 Oral!北大和腾讯优图破解AI生成图像检测泛化难题:正交子空间分解
OpenAI推出GPT - 4o图像生成功能,AI生图安全挑战凸显,区分生成与真实图像成难题。北大与腾讯优图研究人员用正交子空间分解解决AI生图检测泛化难题,论文被ICML 2025接收。
无需CUDA代码给H100加速33%-50%,Flash Attention作者新作火了
Flash Attention、Mamba作者之一Tri Dao与普林斯顿博士生提出QuACK库,用Python写,无需CUDA C++。在H100上比优化库快33%-50%,吸引英伟达、PyTorch团队关注。还给出优化torch.compile建议。
无损加速视觉语言模型推理!轻松剪掉视觉冗余Token|腾讯AI Lab
多图像、长视频让大型视觉语言模型推理成本暴涨,成算力瓶颈。腾讯AI Lab联合CMU提出VScan,通过两阶段视觉token筛选机制,在几乎不损性能的前提下实现推理加速,且已在GitHub开源。
一文看懂“提示词” vs “提示词工程” vs “上下文工程”
文章区分了提示词、提示词工程和上下文工程的概念。提示词是给AI模型的输入文本;提示词工程是设计、测试、优化提示词的过程;上下文工程是为大模型构建动态上下文的学科,在AI Agent背景下诞生。
OCR-Reasoning:揭秘多模态大模型在复杂图文推理中的真实能力
主流OCR评测基准聚焦信息抽取,复杂图文推理任务中多模态大模型深度推理能力缺乏评估标准。OCR - Reasoning可系统性评估,还列举多种推理示例,并测评了Qwen2.5 - VL - 7B模型。