← 玄知密码大模型
全部项目
技术阅读库 · ByteTech
玄知密码大模型 · 后训练阅读库
围绕领域大模型后训练全链路整理:CPT / SFT / 偏好对齐 / GRPO、训练数据工程、微调避坑,以及少量密码学领域背景。
需 ByteTech 权限访问
后训练 / RLVR
说明:本页仅做外部链接索引与一句话摘要,不转载 ByteTech 全文内容。
后训练全链路 · 技术选型
大模型冷启动、监督微调、基于偏好的对齐技术方案现状
冷启动 DAPT / 合成数据 / PEFT-LoRA / RAG → SFT → DPO / KTO / GRPO 的完整选型,对应玄知 CPT→SFT→DPO→GRPO 全链路。
SFT 记忆,RL 泛化,如何将两者的优势整合
解释 SFT 与 RL 的能力分工,支撑垂域后训练里先指令适配、再 RL 泛化的叙事。
GRPO / 强化学习实战
DeepSeek-R1 模型及 GRPO 算法学习
GRPO 组内相对优势、去 critic 和 R1 训练范式的基础材料。
从零实现 REINFORCE / GRPO —— 大模型推理强化微调实践
从 REINFORCE 到 GRPO 的工程实现,帮助解释 advantage、KL 与 loss 细节。
LLM-as-a-Judge 在 GRPO 中的应用
用裁判模型构造 reward 信号,连接评测经验与 RL 后训练。
DAPO 强化学习算法浅析
GRPO 改进变体,理解后训练 RL 算法的前沿演进。
数据工程 · 微调经验 · 避坑
专题分享:大模型数据工程技术点
数据清洗、去重、配比与质量控制,对应玄知约 5B tokens 语料流水线。
什么是高质量的数据?
训练数据质量判定标准,支撑 SFT / 偏好数据构造的面试解释。
一个外行的大模型微调心得
微调实践踩坑与经验,可用于补充训练细节问答。
密码学领域背景
系统安全串讲 · 密码学基础与应用
作为玄知的领域背景材料,面试主线仍聚焦大模型后训练而非密码学细节。
← 返回项目详情