贾永琪的技术博客

从一条直线到大模型输出一个token(七):注意力权重与多头机制

从一条直线到大模型输出一个token(七):注意力权重与多头机制 建议先看:从一条直线到大模型输出一个token(六):QKV 三剑客 上一篇备齐了 Q(查询单)、K(名片)、V(内容),篇尾的热力图已经"偷看"了 Q·K 的配对分。这一篇把注意力的完整流程走通:打分、缩放、Softmax、加权取 V,最后解锁多头机制。 1. 全景:注意力的四步流水线 先把主角公式摆上来: Attention (

【教程】打通本地 IDE AI 与云端 AI 的记忆壁垒:基于 COS 的跨 AI 终端记忆共享与通信系统

【教程】打通本地 IDE AI 与云端 AI 的记忆壁垒:基于 COS 的跨 AI 终端记忆共享与通信系统 摘要 本文详细介绍如何基于腾讯云 COS 对象存储构建一套跨 AI 终端的记忆共享与异步通信系统。实现本地 IDE 内置 AI(如 CodeBuddy)与云端 AI(如企微 Bot)之间的记忆双向同步、智能融合与异步通信。包含完整的架构设计、核心代码实现、融合策略、信箱协议、定时任务配置和新

【算法】树(一):递归的艺术——分解与遍历、两通道与死亡信号

【算法】树(一):递归的艺术——分解与遍历、两通道与死亡信号 摘要 树系列第一篇。从数组和链表转场树,先修课出乎意料地少——因为树的递归和链表的递归是近亲,分解式和 DP 是同一个灵魂。本篇五题五课:LC104 最大深度(树形 DP 的入门形态;"哨兵信任"课——设了哨兵却包 if != nil 防御,等于不信任自己的哨兵);LC226 翻转二叉树("分解式 vs 遍历式"的分界课——我嘴选分解式

从一条直线到大模型输出一个token(六):QKV 三剑客

从一条直线到大模型输出一个token(六):QKV 三剑客 建议先看:从一条直线到大模型输出一个token(五):Transformer Block 全景与层归一化 上一篇把 Block 的结构图和 LayerNorm 讲完了。这一篇进入 Block 里最核心的部件——多头自注意力的第一步:Q、K、V 三个矩阵是怎么算出来的,各自代表什么。 1. 一个比喻:图书馆式的分工 先把 QKV 的角色用一

【算法】双指针与滑动窗口(三):相向双指针——比较、排除、收缩

【算法】双指针与滑动窗口(三):相向双指针——比较、排除、收缩 摘要 双指针系列第三篇,相向双指针专题。三道题讲透"比较、排除、收缩":LC167 两数之和 II(裸题;一版过,但这题的判决书有个反直觉的结构——淘汰 r 时,论证的全部内容却是 l 的未来:"不动的那边"才是死刑判决的依据);LC11 盛最多水的容器(排除论证的原题;代码一次过、证明欠着的病历——“谁矮动谁"凭什么安全,矮边的所有

从一条直线到大模型输出一个token(五):Transformer Block 全景与层归一化

从一条直线到大模型输出一个token(五):Transformer Block 全景与层归一化 建议先看:从一条直线到大模型输出一个token(四):位置编码 RoPE 上一篇末尾留了个悬念:「苹果」在"我吃了一个苹果"里是水果,在"苹果发布新手机"里是公司——同一个 token,含义要靠旁边的词决定。从这一篇开始,我们正式走进 Transformer 大厦,看词和词怎么"发生关系"。 1. 先看

【算法】回溯算法(二):五个坑与一次验收——决策、切片与去重

【算法】回溯算法(二):五个坑与一次验收——决策、切片与去重 摘要 回溯系列第二篇,翻车实录上半场。上一篇沉淀的模板十分钟就能背下来,但背下来和会用是两回事——本篇记录我在五道题上真实翻车的经历:决策粒度过粗(括号生成缺解)、Go 切片引用(全排列丢一半结果)、"要/不要"模型滥用(三道题同一个错)、同层去重(同一考点三次没接住,含 [1,2,2] 怎么生成的 8 条路径推演)、范式识别(该用 D

【算法】双指针与滑动窗口(一):框架总纲——三类问题、一个原理与判决书

【算法】双指针与滑动窗口(一):框架总纲——三类问题、一个原理与判决书 摘要 双指针/滑动窗口系列第一篇,只讲框架不讲题。这个结构本身是一次纠错的结果:我先前按"一题一题做、批改里提炼要点"的方式学这个系列(LC3 写了五版、LC15 四版、LC76 一版过但被拷问),十来道题做完,某天被自己问倒——"双指针的核心原理到底是什么?"竟然答不上来。回溯系列我有"选择、递归、回退"六个字,DP 系列我