「文本交互」共找到 1039 篇相关文章
论文秒变海报!开源框架PosterAgent一键生成顶会级学术Poster
本文介绍开源框架PosterAgent,它能一键将论文转为可编辑的学术海报。相比GPT - 4o,其生成指标优、token使用量少、成本低。研究团队构建评估标准Paper2Poster,实验显示PosterAgent在多方面表现出色。
SOTA大模型遇上加密数据评测:Qwen3未破10%,o1也栽了丨上海AI Lab等联合研究
当前推理模型在基准测试中性能卓越,但在密码学领域推理能力待探索。上海AI Lab等推出CipherBank评测,用海量真实隐私场景数据和多类型密码算法挑战SOTA大模型,结果显示模型表现不佳,还分析了模型“犯难”原因。
「神经软件」正在到来,人类代码将失去意义!
Lambda Labs CEO Stephen Balaban 在英伟达 GTC 2025 提出神经软件概念,指不再写代码,让大语言模型成软件。它没传统软件的 bug 问题,未来计算机或端到端神经化,虽有争议,但变革在加速。
豆包可以跟你打视频了,陪我看《甄嬛传》还挺懂!难倒一众AI的“看时钟”也没难倒它
国产AI豆包发布视频通话新功能,能实时报准时钟时间,还接入联网搜索,准确性和时效性强。实测中,它可当看剧搭子,还能识别食材、解答物理题等,背后是豆包·视觉理解模型在发力。
Gemini 2.5 Pro登顶三冠王!AI最强编程屠榜,全面碾压Claude 3.7
谷歌Gemini 2.5 Pro(I/O版)横空出世,登顶LMAreana获文本、视觉、编码三连冠,编程能力碾压Claude 3.7。开发者可通过Google AI Studio等使用,其应用演示展现强大实力。
11篇顶会论文之外,美图影像研究院做了一件事:让大众爱用AI
过去两年,AI 生成图片、视频变得容易,但让 AI 理解并按创作者意图创作很难。美图影像研究院过去几年围绕高频创作场景痛点展开研究,11 篇论文被国际顶会接收,成果通过产品落地转化为 AI 影像能力。
Claude骂声中启动「隐形水印」:新模型全量嵌入,标记所有文字
Anthropic宣布新款Claude将在生成文本中嵌入隐形水印,还会给特定文件附加数字签名元数据,全球统一施行。此前A社就用Unicode贴暗标,虽称不影响生成质量,但遭质疑。
看傻了!5k Star Canvas Editor,我被惊到啦~~~~
Canvas Editor是基于HTML `<canvas>` API的文档编辑器,自己控制绘制、分页、交互和导出。文章介绍其与普通编辑器差异、核心能力、适用场景、接入代码,也指出项目限制,认为它是架构新选择。
微软开源Skill训练框架,让Agent白天干活,晚上自动复盘,Skill的自进化终于可监控了
微软开源SkillOpt v0.2.0,加入SkillOpt - Sleep让Agent可自我复盘。该文本空间优化框架能自动训练和优化skill,有透明化、质量控制等特点,适合重复、可评估任务场景。
SIGCOMM 2026 | 从「人眼看视频」到「AI理解视频」:北大提出面向AI的实时通信框架Artic
AI 正从「文字聊天」走向「边看边聊」,传统实时视频通信难以满足需求。北大团队提出 Artic 框架,重构码率自适应等,实验显示其能显著提升准确率、降低延迟。