NJAVA / AI FIELD NOTES · 2026

把 AI 拆开,
再重新搭起来。

一份写给实践者的中文技术地图。从第一个符号,到会调用工具的 Agent;从一行数据,到一次可靠的推理。

09个主题
01张全景图
次继续迭代

PATH / 00

从数据,到一个
可用的回答

不要把 AI 看成一个黑盒产品。把它放回完整链路里:数据决定边界,训练塑造能力,推理把能力变成行为,Agent 再把行为接到世界。

01

数据

采集、清洗、标注、切分

02

训练

损失函数与梯度更新

03

对齐

让模型更像一个助手

04

推理

token 逐步变成回答

05

Agent

调用工具,完成任务

01

HISTORY / 时间线

AI 的历史,
不是一条直线

每次跃迁都不是凭空发生:新的表示方式、新的数据规模和新的计算基础,恰好在同一个时刻相遇。

“我们能否描述一个机器,使它表现出智能?”

— 达特茅斯会议提案,1955

THESIS

AI 不只是算法史,也是人类不断更换问题表述的历史:从规则,到特征,再到表示和交互。

1950—69

符号主义 · 把知识写成规则

图灵测试、感知机与早期搜索奠定了问题的语言。专家系统随后把领域知识编码成 if / then。

RULES
1980—99

连接主义 · 从样本里学习

反向传播让多层网络重新获得生命。统计学习开始取代手工规则,数据成为新的知识载体。

FEATURES
2012

深度学习 · 表示学习破圈

大规模数据、GPU 与更深的网络在视觉任务上形成合力,端到端学习进入主舞台。

REPRESENTATION
2017

Transformer · 注意力成为主线

自注意力让序列中的关系可以并行计算,语言模型从“预测下一个词”走向通用基础设施。

ATTENTION
2020s—

基础模型 · 从回答到行动

模型、工具、检索和多模态能力开始组合。真正的产品边界,从模型本身扩展到了系统设计。

SYSTEMS
02

PRINCIPLES / 原理

模型做的事,
可以画出来

神经网络不是在“理解”一段文字,而是在层层变换表示,最后对下一个 token 的分布做出估计。

A LANGUAGE MODEL IN 5 MOVES

输入是一串符号,输出是下一个符号的概率。中间的每一步,都是可观察、可测量的表示变化。

  1. 01AaToken切成模型认识的片段
  2. 02Embedding放进高维向量空间
  3. 03Attention寻找上下文中的关系
  4. 04Transformer重复堆叠表示变换
  5. 05Logits变成下一词的分布
P(xt | x<t)模型在给定历史 token 的条件下,预测下一个 token。
01 / SUPERVISED

回归与分类

用带标签的样本学习一个映射:预测连续值是回归,预测类别是分类。

输入 → 特征 → 标签
02 / VISION

CNN 卷积网络

用局部感受野捕捉边缘、纹理与形状,再逐层组合成更高层的视觉特征。

局部 → 全局
03 / SEQUENCE

RNN 与状态

把前一步的隐藏状态带到下一步,适合描述序列,但长距离记忆会变得困难。

时间步 t → t + 1
04 / FOUNDATION

Attention & Transformer

每个位置都可以查询其他位置,按相关性聚合信息;多头注意力让模型同时观察不同关系。

query × key → value
05 / DECISION

强化学习

智能体与环境交互,以奖励信号调整策略;重点从“像不像答案”变成“行动是否有效”。

探索 ↔ 利用
03

STACK / 生态

框架是骨架,
产品是肌肉

同一个模型,经过不同的训练、编排、部署和评估工具,会成为完全不同的系统。先看分层,再选工具。

应用层模型层系统层硬件层
应用 / ORCHESTRATE把能力放入业务工作流
模型 / TRAIN定义、训练、微调与评估
系统 / SERVE让请求稳定、快速地到达模型
A

先定义约束

延迟、显存、数据合规、许可证,往往比“哪个框架最流行”更能决定选择。

B

再组合工具

框架不是信仰。训练和推理可以来自不同生态,接口清晰比全家桶更重要。

C

最后测真实任务

基准分数只是起点;用自己的数据、成本和失败案例验证,才算完成选型。

04

CLI / AGENT

CLI 是入口,
Agent 是循环

当模型可以读取上下文、选择工具、检查结果,它就从“回答问题”变成了“推进任务”。能力来自循环,而不是一句神奇的 prompt。

njava-agent / session-014 running

$ agent run --task "检查本周发布"

正在拆解任务 ···

THOUGHT需要读取 changelog,并核对 CI 状态。

调用工具 read_file

TOOL✓ CHANGELOG.md · 12 条变更

调用工具 check_ci

CHECK! 1 个 job 仍在运行,等待 8s

复核上下文 ···

✓ 已生成发布摘要,等待确认。

$

AGENT
LOOP
可控的
行动系统
01Observe读取上下文
02Plan拆分任务
03Act调用工具
04Verify检查结果
DESIGN CHECKLIST
边界权限与沙箱
观察日志与轨迹
验证结果可复现
退出人工接管
05

ADAPT / 微调

不要重造模型,
先改变它的习惯

微调不是让模型凭空获得所有知识,而是用更少、更聚焦的数据,把输出格式、语气和任务策略推向目标。

01BEHAVIOR

SFT · 监督微调

准备“指令—回答”样本,让模型学习什么样的请求对应什么样的行为。

prompt+answerstyle
适合什么时候?

需要稳定输出格式、领域术语或操作步骤时。样本质量通常比样本数量更关键。

03PREFERENCE

DPO · 偏好优化

给同一个问题的多个回答排序,让模型更倾向于符合偏好的输出,而不只追求字面正确。

先做什么?

先写出可执行的偏好标准,再收集成对数据;模糊的偏好会被模型放大。

RETRIEVAL OR FINE-TUNING?

先问:问题是知识,还是行为?

需求优先考虑为什么
资料经常更新检索增强(RAG)知识放在外部,更新成本低
固定格式与语气监督微调让行为稳定,减少 prompt 负担
有限显存、快速试验LoRA / QLoRA只训练小规模适配器
06

DATA / 数据集

数据不是燃料,
数据是课程

模型能学到什么,首先取决于你让它反复看见什么。数据集的边界,就是模型能力的边界。

01Collect采集来源
02Clean去重与清洗
03Label标注与构造
04Split训练 / 验证 / 测试
05Audit偏差与泄漏检查
DATA HYGIENE

一份数据的体检单

  • 来源与许可可追溯
  • 重复、模板和垃圾已处理
  • 训练集与测试集没有泄漏
  • 不同人群、语言、场景有覆盖
  • 难例和失败案例被保留
QUALITY × SCALE
价值规模
低质
重复
有效
覆盖
高质
难例
数据量 →

质量与规模不是二选一,但在预算有限时,优先找到能改变评估结果的数据。

07

TRAIN / 训练

训练,是和损失函数
反复谈判

每一步都在问:预测和目标差多远?梯度把答案传回网络,优化器再决定下一步往哪里走。

ONE OPTIMIZATION STEPLOOP / 10⁶
batch取一小批样本
forward得到预测
loss计算差异
backward传播梯度
update更新参数
step 0step nloss ↓
KEEP AN EYE ON
过拟合训练集很好,验证集变差
数据泄漏答案悄悄出现在输入里
梯度异常爆炸、消失或突然漂移
可复现配置、种子、版本可追溯
08

INFERENCE / 推理

训练决定能力,
推理决定体验

用户只看见回答,但工程师要同时看见首 token 延迟、吞吐、显存、上下文长度与失败率。

GENERATION CONTROLScreative / balanced
LATENCY MAP
TTFT首 token120 ms
TPOT每 token24 ms
THROUGHPUT并发吞吐42 tok/s

把“快”拆成多个指标,才能知道优化到底改变了什么。

SERVING PATH
requestqueuebatchKV cacheresponse

连续批处理、量化和 KV cache,是大模型服务常见的三组杠杆。

QUANTIZATION

精度不是越高越好,
而是要和场景匹配。

FP1616 bit质量基线 / 显存高
INT88 bit工程常用 / 平衡
INT44 bit本地友好 / 需验证
09

OPEN WEIGHTS / 开放权重

把模型带回自己的机器,
也把责任带回来

开放权重让部署、研究和微调更自由,但“能下载”不等于“能随意使用”。模型卡、许可证和数据来源都要一起看。

下载之前,先读模型卡

许可证、商用限制、训练数据声明、可接受使用政策和安全评估,都会随版本变化。这里的名称用于导航,不构成许可建议。

了解模型卡