LLM 学习笔记——扩散模型学习 TODO
Created|Updated|llm
|Word Count:165|Reading Time:1mins
目前的深度学习笔记只覆盖了 RNN、LSTM 这种循环神经网络和 Transformer 模型, 还可以加上扩散模型部分,毕竟 Transformer 和扩散模型算是大模型领域最著名的两个基石了,前者是主流大语言模型的基础,后者则是主流图片和视频生成模型的基础。
刷了一些短课程,但是目前没空整理笔记,有时间再说。
参考资料:
Author: Fenglielie
Copyright Notice: All articles on this blog are licensed under CC BY-NC-SA 4.0 unless otherwise stated.
Related Articles

2025-12-17
LLM 代码练习——在 shell 中询问大模型
一个简单的代码练习,解决编程实践中的痛点问题:直接在 shell 中询问大模型具体的 shell 命令。 类似的项目: https://github.com/TheR1D/shell_gpt https://github.com/ChenZiHong-Gavin/easy-shell 完整源码(无任何非标准库的依赖) 12345678910111213141516171819202122232425262728293031323334353637383940414243444546474849505152535455565758596061626364656667686970717273747576777879808182838485868788899091929394959697989910010110210310410510610710810911011111211311411511611711811912012112212312412512612712812913013113213313413513613713813914014114214314414514614714...

2026-03-01
纯 Python 实现深度学习代码
microgpt.py 是 Andrej Karpathy 写的一个教学项目,几百行纯 Python 实现完整的 GPT 训练和推理流程,不依赖 PyTorch,甚至不依赖 Numpy! 受到这个项目的启发,我们在原有代码的基础上进一步扩展,从标量自动求导框架开始,依次实现 MLP、RNN、LSTM 和 Transformer 模型,仍然保持纯 Python 的风格,当然代价就是比基于 PyTorch 等的实现慢很多。由于这里只是作为演示项目,训练得到的模型看起来还是在胡言乱语。 自动求导由于不依赖 PyTorch 和 Numpy,首先需要一个 Value 类来实现自动求导,为后续的训练和推理提供基础。 训练神经网络的核心是知道损失函数 $L$ 对每个参数 $\theta$ 的梯度 $\partial L/\partial\theta$,再沿梯度反方向更新参数。手工推导每一层的梯度既繁琐又容易出错,自动求导则把前向计算记录成一张计算图,然后从损失节点开始反向应用链式法则。 例如 $y=f(g(x))$,链式法则为 $$ \frac{\partial y}{\p...

2026-01-17
LLM 代码练习——API 代理
一个单文件的 OpenAI 兼容 API 代理脚本,用来转发请求到上游服务,并记录请求与响应日志,可以用来测试大模型服务。 flowchart LR; A[OpenAI 兼容客户端] -->|HTTP 请求| B[llm-proxy] B -->|转发请求| C[上游大模型服务] C -->|返回响应| B B -->|返回响应| A B -.->|记录请求与响应| D[日志文件] 用法直接运行: 1uv run llm-proxy.py --upstream-base-url https://your-upstream.example.com/v1 常用参数: --upstream-base-url:上游服务地址 --host:监听地址,默认 127.0.0.1 --port:监听端口,默认 8000 --log-dir:日志目录,默认 ./logs --upstream-timeout:上游请求超时,默认 300 llm_proxy.py 头部已内联声明依赖,uv run 会自动处理单脚本的依赖:提...

2025-10-17
LLM 代码练习——调用 API 进行简单聊天
一个简单的调用 LLM API 的大模型单次对话脚本,通过 --input 和 --prompt 参数提供输入文件和系统提示文件,输出到标准输出流。 脚本调用 LLM 的方式不依赖 openai 等提供的第三方库,完全使用 Python 标准库实现。 chat-with-prompt.py1234567891011121314151617181920212223242526272829303132333435363738394041424344454647484950515253545556575859606162636465666768697071727374757677787980818283848586878889909192939495969798991001011021031041051061071081091101111121131141151161171181191201211221231241251261271281291301311321331341351361371381391401411421431441451461471481491501511521531...

2026-02-01
LLM 学习笔记——理论基础
Some content in this article was created with AI assistance. Please verify as needed.这份笔记关注大模型的理论基础。 毫无疑问的是,在大模型领域,实践是远远走在理论前面的,但是基础理论的缺乏并不是致命的阻碍。一个历史上的例子是:“在蒸汽机已经大规模应用的年代,热力学的重要定理一条都还没搞出来,工程师完全凭借的是经验或错误的热质说。等到这些热力学定理终于写出来时,蒸汽机已经跑了几十年甚至上百年。” 为什么大语言模型能够成功近年来,大语言模型(Large Language Models, LLM)在自然语言处理领域取得了显著进展。相比早期的机器学习方法,大语言模型能够在统一模型框架下完成多种语言任务,并在多个基准测试中取得较好的性能。 这种成功通常被认为是多个因素共同作用的结果,包括: Transformer 架构提供了可扩展的序列建模方式。 预训练语言模型范式让模型可以先学通用能力,再适配具体任务。 海量文本和代码数据提供了足够丰富的训练数据。 自监督学习让数据规模可以大到互联网级别。 ...

2026-03-02
LLM 学习笔记——模型与 Agent 基础知识
Some content in this article was created with AI assistance. Please verify as needed.本文关注大模型的用户使用,整理一下大模型与 Agent 工具的基础知识。 大模型分类大模型可以按定位分类: 旗舰模型 日常模型 低成本模型 多模态模型 … 还可以按开放程度可以分类: 闭源模型:只能通过官方产品、API、云平台或聚合平台访问。通常能力领先、产品体验完整,但版本和价格由厂商控制。 开放权重模型:公开权重和主要架构信息,但训练数据、训练代码和完整训练流程通常不公开。优点是可私有部署、可固定版本、可微调。 完全开源模型:尽量公开训练代码、数据处理、权重和复现流程,多见于研究社区。 常见概念 上下文窗口:指模型一次调用能看到的 token 总量,包括输入、历史对话、工具结果、文件内容和系统提示等 由于长对话每次会把之前所有对话内容都提交,在内容长度接近上下文窗口时,需要使用 Agent 工具对之前的对话内容进行压缩(手动压缩或自动触发) 越强的大模型,支持的上下文窗口越大。但是实际使用中,长对话的...