MCP 模型上下文协议
MCP 协议基本架构(图源)

- 由 Anthropic 提出,用于标准化 LLMs 与外部系统交互的接口
- 开发者能以统一的方式将大模型对接到各种数据源和工具
- MCP 采用了经典的 C/S 架构,包含主机、服务端和客户端三部分
目前 MCP 协议已得到了广泛的生态支持,兼具通用性和灵活性
MCP 底层通信
MCP 的会话管理
- 通过一个健壮
分类目录归档:DeepLearning
MCP 协议基本架构(图源)

目前 MCP 协议已得到了广泛的生态支持,兼具通用性和灵活性
MCP 的会话管理
前置知识: 10.《动手学深度学习》注意力机制
原始 Tansformer(左) VS 线性 Tansformer(右):

大语言模型(LLMs)的上下文学习:经过预训练的 LLMs 能根据文本提示或任务示例来直接对下游任务进行预测,而无需更新模型权重,这种能力也被称为上下文学习(in-context learning,ICL)或语境学习
简单来说,ICL 就是在不更新模型参数的前提下,通过输入经典示例作为提示来增强模型的能力
以情感分析为例,来说明 ICL 的一般流程(图源):

ICL 的分类:
TabPFN 的主要特点:
贝叶斯神经网络(Bayesian neural networks, BNNs):
方案:将 config.json 文件中 num_hidden_layers 的值修改为较小的值(比如 1)
原理:隐藏层中 block 的输入输出维度是一致的,因此去除重复的 block 并不会影响模型的处理逻辑;但需要注意该方法会影响模型的性能,因此只适合模型调试阶段使用。
分层推理法:将模型根据层来进行拆分存储,推理时分批次将要处理的层导入显存
代码示例:
from accelerate import init_empty_weights
from accele模型融合(model merging):
思考:如何验证模型融合的合理性? (此处
循环神经网络(RNNs):具有隐状态、不同层参数共享的神经网络
常见的三种基础 RNNs :RNN、GRU、LSTM
隐变量模型:使用隐状态 $h_{t-1}$ 存储前 $t-1$ 步的序列信息 $$P(x_t|x_{t-1},...,x_1)\approx P(x_t|h_{t-1})$$ $$h_t=f(x_t,h_{t-1})$$ 循环神经网络(recurrent neural networks,RNNs) 是具有隐状态的神经网络
假设时刻 $t$ 的输入为 $X_t \in \mathbb{R}^{n\times d}$,对应的权重参数为 $W