Selected notes
探索未知之境
关注我,在 AI 这条路上,见证我成为大佬的每一步。
精选
llama.cpp 跑 Qwen3-0.6B:HTP 上从 20 到 70 token/s
一次 Snapdragon Hexagon HTP 上的真实调优记录:OPPOLL、算子过滤、lm-head 量化,以及为什么 70 token/s 不是“全上 NPU”跑出来的。
llama.cpp Hexagon NPU 量化:Q4_0 / IQ4_NL / MXFP4 / Q8_0
对比 llama.cpp Hexagon HTP 支持的 Q4_0、Q4_1、IQ4_NL、MXFP4、Q8_0 格式,解释存储表示、反量化 kernel 和格式选择。
TVM 是什么:层级架构与编译流水线
通过 TVM 的 Relax、TIR、Target 和 Runtime 分层,跟踪一个 matmul + add 模型如何从图表示逐步编译为目标设备代码。
llama.cpp 高通 Hexagon NPU 初跑 Qwen3.5 4B 模型
记录 llama.cpp 在 Snapdragon 8 Gen 2 / Hexagon HTP v73 上部署 Qwen3.5-4B 的模型转换、交叉编译、板端运行和实测速度。
TVM FFI(一):对象系统与调用约定
TVM FFI 的核心骨架:引用计数对象系统、类型擦除容器 TVMFFIAny、Packed Function 调用约定,以及 DLPack 零拷贝张量传递。
最近文章
【arXiv】Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models
更新于:从 n-gram 哈希、上下文门控和模型内的数据流出发,解读 DeepSeek Engram 怎样与 Transformer、MoE 配合,核对能力收益,并解释它为何仍然自回归、也不等于推理加速开关。
BigMoeOnEdge:端侧 MoE 专家流式推理原理与实测
更新于:结合 BigMoeOnEdge 的架构图和两组 Android 端实验,解释专家权重流式加载、缓存与 I/O 调度,并比较 mmap、repack 和 HTP Prefill 的性能边界。
Jev 到底是什么:结构化决策 API、开源生态与工程边界
从 TypeSafe 官方资料、Jev 解读站、Datawhale Cookbook 和独立论文出发,解释 Jev 的类型化决策 API、概率与置信度,并梳理闭源服务与开源生态的边界。
QNN W8A16 的 INT32 Bias Overflow:从极小 Scale 到稳定部署
记录 QNN HTP W8A16 中 INT32 bias 溢出的根因、公式、QueOpt 修复方式,以及在真实板端的验证结果。
从 LoRA 到 QLoRA、QA-LoRA:低秩更新如何进入量化模型
用一个完整的数值例子解释 LoRA、QLoRA 和 QA-LoRA 的训练、推理与合并流程,并拆开 QA-LoRA 官方实现中的 group pooling 和 qzeros 写回。
从权重角度理解均匀量化与向量量化
用权重矩阵、scale/offset、码本和索引,拆开解释均匀量化与向量量化到底在压缩什么、如何反量化,以及为什么码本大小会决定 bit 数。

