文章
所有文章。
【arXiv】Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models
更新于:从 n-gram 哈希、上下文门控和模型内的数据流出发,解读 DeepSeek Engram 怎样与 Transformer、MoE 配合,核对能力收益,并解释它为何仍然自回归、也不等于推理加速开关。
BigMoeOnEdge:端侧 MoE 专家流式推理原理与实测
更新于:结合 BigMoeOnEdge 的架构图和两组 Android 端实验,解释专家权重流式加载、缓存与 I/O 调度,并比较 mmap、repack 和 HTP Prefill 的性能边界。
Jev 到底是什么:结构化决策 API、开源生态与工程边界
从 TypeSafe 官方资料、Jev 解读站、Datawhale Cookbook 和独立论文出发,解释 Jev 的类型化决策 API、概率与置信度,并梳理闭源服务与开源生态的边界。
QNN W8A16 的 INT32 Bias Overflow:从极小 Scale 到稳定部署
记录 QNN HTP W8A16 中 INT32 bias 溢出的根因、公式、QueOpt 修复方式,以及在真实板端的验证结果。
从 LoRA 到 QLoRA、QA-LoRA:低秩更新如何进入量化模型
用一个完整的数值例子解释 LoRA、QLoRA 和 QA-LoRA 的训练、推理与合并流程,并拆开 QA-LoRA 官方实现中的 group pooling 和 qzeros 写回。
从权重角度理解均匀量化与向量量化
用权重矩阵、scale/offset、码本和索引,拆开解释均匀量化与向量量化到底在压缩什么、如何反量化,以及为什么码本大小会决定 bit 数。