「视觉分析」共找到 1718 篇相关文章
藏师傅教你做即将爆火的AI玄学祈福壁纸,不止提示词还有创作思路
作者歸藏分享AI许愿祈福壁纸教程,给出提示词模板,分析其结构,介绍从画面结构、人物描述、排版内容三部分改动来产生创意,还提及更改内容模态及向其他文化方向发散创意。
航空发动机用上大模型:解决复杂时序问题,性能超越ChatGPT-4o实现SOTA|上交创智复旦
上海交通大学李元祥教授等团队提出ITFormer架构,构建EngineMT-QA数据集。ITFormer能融合时序数据与大语言模型,适配多种编码器和模型,在EngineMT-QA预训练后达SOTA水平,实现高效数据分析。
思维锚点:破解LLM Reasoning黑箱的关键句
文章提出思维锚点概念,指推理轨迹中影响后续步骤和答案的关键句。开发三种归因方法,系统论证高级组织句影响力更大,锚点主导错误修正。研究为理解LLM推理机制开辟新途径,开源工具支持可视化分析。
图像分词器造反了!华为 Selftok:自回归内核完美统一扩散模型,触发像素自主推理
华为盘古多模态生成团队推出 Selftok 技术,通过反向扩散将自回归先验融入视觉 token。它突破传统,实现因果 token、强化学习友好型 token 及纯 AR 大一统架构,实验在多方面表现优异,论文还入选 CVPR 2025 最佳候选。
让大模型“吃一堑长一智”,南理工百度等提出模型记忆新方法
南京理工大学联合百度等提出新方法ViLoMem,构建视觉流+逻辑流的双流语义记忆,让模型“从错误中学习”。它能在多模态基准提升模型表现,强模型记忆还可迁移给小模型。
浅谈上下文工程|从 Claude Code 、Manus 和 Kiro 看提示工程到上下文工程的转变
文章围绕上下文工程展开,介绍其概念、组成与提示工程区别,通过演示说明价值。还分析业界产品实践,如LangChain管理方法、Claude Code架构机制、Manus优化实践、Kiro开发模式,最后展望环境工程。
Claude Code出逃的主创又回来了!Anthropic:过去俩月我收入暴涨5.5倍,别走
Claude Code两位主创跳槽Cursor两周后回归Anthropic。Anthropic正洽谈新一轮融资,估值目标1000亿美元。其赚钱能力强,Claude Code表现亮眼,还将推分析仪表盘,Cursor收入增长也惠及它。
国产多模态Agent拿下医学分割SOTA!不用改模型、不加token | 浙大&上海AI Lab
现有医学多模态大模型在分割生物医学图像时存在瓶颈,浙大蔡钰祥教授、上海AI Lab江彦开等人提出IBISAgent框架,将分割定义为多步视觉决策过程,实验显示其在多数据集上大幅领先对比方法。
造火箭的辞职去放牛,彼得·蒂尔花20亿美元押注一个AI牛项圈
彼得・蒂尔领投20亿美元融资给Halter公司的AI牛项圈。项圈能追踪牛的多项数据,有虚拟围栏功能。此外,何同学为粉丝做找牛系统,日本团队开发分析鸡情绪的AI系统。
马斯克将用最强Grok 5,挑战LOL最强战队T1!
马斯克让Grok 5戴「纯视觉感知」与「拟人延迟」镣铐挑战LOL传奇战队T1。这是终极图灵测试,AI像人一样感知与推理。对决为特斯拉Optimus练兵,若AI看懂团战,就能理解现实世界。