跳到主要内容

端侧部署术语表

本页只收录课程中反复出现、会影响实验判断的术语。更细的公式约定见 公式与符号约定。

公开资料怎么转成本页术语​

公开课程和官方文档会使用很多相同词汇,但上下文不同:LLM 课程强调 tokenizer、chat template 和生成流程,量化资料强调 scale、zero-point、outlier 和 calibration,serving/runtime 资料强调 TTFT、throughput、KV Cache 和 API,Jetson/benchmark 资料强调内存、温度、功耗和可复现条件。本页只保留会影响本课程实验判断的词。

术语来源本页吸收什么为什么保留
Hugging Face LLM / Transformerstokenizer、chat template、prefill、decode、KV Cache解释 Qwen 输入格式、首 token 和长上下文
DeepLearning.AI / PyTorch / ONNX 量化资料calibration、scale、zero-point、outlier、低比特支撑 Q8/Q5/Q4 和质量退化判断
Qwen / llama.cpp 文档GGUF、Q4/Q5/Q8、GPU offload、ctx-size、server对齐课程主线实验命令和日志字段
vLLM / serving / OpenAI-compatible API 资料TTFT、throughput、P50/P99、服务开销区分 CLI 指标和 API 端到端体验
Jetson / MLPerf / Nsight / llama-benchfallback、thermal throttling、指标条件写入 profiling、排障和最终报告风险

本课程重绘:术语分类图​

外部图分别对应本课程术语表里的四类词:输入链路、量化对象、服务指标和边缘设备。学生遇到不熟悉的词时,先判断它属于哪一类,再回到具体章节。

来源图重点对应术语用来回答什么问题
Hugging Face NLP pipelinetokenizer、pipeline、post-processing输入输出到底经过哪些步骤
vLLM quantization schemesscale、zero-point、weight-only、KV CacheQ8/Q5/Q4 到底量化了什么
vLLM metricsTTFT、tokens/s、throughput、latency一个速度数字是否足够说明问题
Jetson AI Lab 设备族JetPack、功耗、温度、thermal throttling服务器结果能否迁移到边缘设备

术语表不是百科。每个词都要能回答一个工程问题:它影响哪个命令、哪个日志字段、哪张表,或者最终报告中的哪类判断。

从外部课程或官方文档看到术语时,先按下面这张表转成课程字段:

外部资料里的词本课程怎么记录对应报告位置
model card / files模型来源、许可证、文件名、SHA256第 2 节环境与模型来源
tokenizer / chat templateprompt、role、template 后文本、token 数第 3 节 baseline,第 6 节 API
quantization / calibrationQ8/Q5/Q4、校准样本、评估 prompt第 4 节量化版本对比
TTFT / throughput / tokens/sprompt eval、eval、API elapsed第 3、5、6 节
KV Cache / context lengthctx-size、prompt tokens、内存峰值第 5、7 节
fallback / unsupported opruntime 日志、CPU fallback、失败原因第 7 节风险登记
power / temperaturenvidia-smi、tegrastats、功耗模式第 5、7 节
tool / guardrail / trace工具白名单、确认策略、trace log第 7、8 节
术语一句话解释本课程在哪里用
TTFT从请求发出到第一个 token 返回的时间,也叫首 token 延迟推理指标、API 服务、profiling
tokens/sLLM decode 阶段每秒生成 token 数baseline、量化对比、加速实验
latency单次请求耗时,必须说明测量边界推理基础、服务化
throughput单位时间处理量,传统模型常用 samples/s,LLM 常用 tokens/sbatch、serving、benchmark
P50 / P99延迟分位数,P99 描述尾部慢请求服务化体验和稳定性
prefill处理 prompt 并写入 KV Cache 的阶段Transformer、TTFT、长上下文
decode逐 token 生成的阶段tokens/s、roofline、KV Cache
KV Cache保存历史 token 的 key/value,避免重复计算长上下文、显存、并发
GGUFllama.cpp/ggml 生态常用模型文件格式Qwen 本地部署
Q4/Q5/Q8GGUF 量化格式名,不等价于普通全模型 INT4/INT5/INT8量化对比
GPU offload把部分或全部层放到 GPU 上执行llama.cpp 加速、Jetson
ctx-sizellama.cpp 上下文长度设置KV Cache、内存、TTFT
LoRA adapter微调时保存的低秩增量参数微调、部署回归
QLoRA低比特加载基座并训练 LoRA 的方法小显存微调
chat template把 system/user/assistant 消息转为模型训练格式的模板Qwen、微调、服务化
calibration用代表性样本统计量化范围PTQ、activation 量化
outlier数值分布中少数异常大值,会拉大量化范围SmoothQuant、AWQ、LLM.int8
fallbackruntime 因不支持某算子或格式回退到 CPU 或慢路径profiling、排障
thermal throttling设备过热后降频,导致持续性能下降Jetson、长稳测试
OpenAI-compatible API兼容 /v1/chat/completions 等接口的本地服务形态local API、Agent 集成

容易混淆的词​

容易混淆正确区分
模型文件大小 vs 运行内存运行时还有 KV Cache、activation、workspace、服务进程
TTFT vs tokens/s前者看第一个 token,后者看稳定生成速度
低比特 vs 更快低比特通常更小,是否更快取决于 kernel、带宽和 offload
GGUF vs 量化算法GGUF 是文件格式,Q4_K_M 等是具体块量化格式
CLI 跑通 vs API 可用API 还要验证端口、JSON、超时、日志和资源占用

参考资料​

本章吸收方式: