「Paper2Code」共找到 2752 篇相关文章
谷歌首个原生多模态向量模型发布:Agent 可以用文字搜图片、用图片搜视频了...
谷歌推出首个原生多模态嵌入模型Gemini Embedding 2,通过Gemini API和Vertex AI公开预览。它将文本、图像等映射到统一向量空间,支持多模态交错输入,性能超越现有领先模型,开发者可快速接入。
清华刘知远团队论文:最小化结构改动,短文本到长文本丝滑升级 | ICLR 2026
大语言模型发展中,上下文长度成关键瓶颈,主流架构计算开销大。清华刘知远团队提出《InfLLM-V2: Dense-Sparse Switchable Attention for Seamless Short-to-Long Adaptation》,提出可切换注意力框架,为长上下文研究提供新思路。
前阿里P10毕玄的一张聊天截图竟然火了。
AI Coding发展迅猛,前阿里P10毕玄所在公司决定将技术岗位统一为Agent工程师,不再按技术栈划分。以前按技术栈分工模式合理,但现在程序员需适应变化,不然会被边缘化。
字节Seed最新版原生智能体来了!一个模型搞定手机/电脑/浏览器自主操作
字节Seed发布最新版原生智能体UI - TARS - 2,采用All in one原生设计,表现优于Claude和OpenAI Agent等。它通过多轮强化学习,解决智能体操作图形界面的四大难题,在多测试中表现出色。
【手把手教程】不写一行代码,开发鸿蒙应用,赚华为1万!
作者实测不写代码开发鸿蒙应用流程,介绍华为鸿蒙激励政策,含三档奖励最高1万。还讲搭建DevEco Studio与AI编程环境,用Claude Code开发,以及构建、打包、上架应用步骤和实用技巧。
用“蒸汽机”生成视频,还能音视频一体化交付?
8月21日百度营销发布百度蒸汽机2.0,含多版本,有声版可音视频一体化交付。经测试,其生成视频细节佳、运动规律合理。它能解决影视业诸多痛点,成本低,还可免费使用。
隐藏超多上下文工程(Context Engineering)技巧的框架,来试一试吧!
文章指出多数人构建的AI Agent像Shallow Agent,处理复杂任务能力弱。以Claude Code等为例,介绍深度Agent架构的秘密,如冗长提示词、规划工具等,还推出开源包deepagents方便上手。
Anthropic 新研究:人们如何使用 Claude 寻求支持、建议和陪伴
Anthropic研究聚焦人们用Claude满足情感需求的情况。发现情感化对话仅占2.9%,人们借此解决现实、情感等问题,对话结束时情绪更积极。但研究有局限,未来需应对诸多挑战。
谷歌放的这波免费AI额度,大到很多人以为是假的
谷歌在Google AI Studio上调整Gemini API免费层规则,额度达每分钟100万token,无额外申请门槛。覆盖Gemini 2.5全系列模型,支持多模态输入。开发者反应两极,有人看好,也有人质疑。
独一份!带动效的 PPT 生成 Agent!使用教学&创作思路
作者实现用 Nano Banana Pro 生成带演示动画的 PPT 这一独特功能。介绍了更新后的 PPT 生成 Skills 能力、使用方法、创作思路,还提及成本及对 AI Coding 发展的看法。