My Personal Blog
博客 项目 观测站 工具 | | 中文 EN

博客

关于代码、AI 和产品的思考和笔记。

分类
全部 AI Python project 世界观 中间件 后端 复盘 数据分析 算法
最近 最热
写文章
2026-07-15 · 26 分钟阅读 · 61 次阅读 · AI
从"序列处理"到"大模型":Transformer 的演化与内核
从"序列处理"到"大模型":Transformer 的演化与内核 引言:我们面对的最基本问题在自然语言处理里,最基本的数据形式是 序列(Sequence)——即一串有先后顺序的符号。例如"我爱中国"是一个序列,"Hello world"也是一个序列。模型处理序列时,需要完成两种性质不同的任务:- 理解:捕捉序列中任意两个位置之间的关联。例如"小明...他"相隔很远,但指向同一个人。- 生成:根据
Edit
2026-07-12 · 8 分钟阅读 · 66 次阅读 · 复盘
面试复盘 — 大数据开发工程师
面试复盘 — 大数据开发工程师 · 资深 · Challenging| 字段 | 内容 ||------|------|| 岗位 | 大数据开发工程师 || 级别 | 资深 || 风格 | Challenging || 日期 | 2026-07-12 || 面试环节进度 | 自我介绍 → 技术深挖(3轮) → 系统设计(1轮) → STAR(中断) |--- 一、面试环节记录 1. 自我介绍原始
Edit
2026-07-08 · 23 分钟阅读 · 84 次阅读 · Python
FastAPI + 设计模式 —— 从基础到实战
FastAPI + 设计模式 —— 从基础到实战文档版本:1.0目标读者:有 Python 基础,想系统理解设计模式在 FastAPI 中如何落地的后端开发者。阅读方式:按章节顺序阅读,每章依赖前一章的知识。 第一章:背景与整体架构 1.1 什么是设计模式定义:设计模式是针对软件设计中特定问题的可复用解决方案。它不是可以直接复制的代码,而是一种经验总结出的"模板"或"范式"。设计模式按用途分为三大
Edit
2026-07-07 · 21 分钟阅读 · 83 次阅读 · Python
Python + PostgreSQL + Elasticsearch + Redis 多级缓存架构学习文档
Python + PostgreSQL + Elasticsearch + Redis 多级缓存架构学习文档> 一份从零开始的实战指南,涵盖环境搭建、架构设计、代码实现与数据可视化--- 📖 目录- [概述](概述)- [Windows 环境部署](windows-环境部署) - [1.1 Docker Desktop 安装与启动](11-docker-desktop-安装与启动) - [
Edit
2026-07-06 · 12 分钟阅读 · 55 次阅读 · Python
Python 并发编程完全指南
Python 并发编程完全指南> 定位:面向中高级 Python 开发者的并发/并行知识库 > 前置知识:熟悉 Python 基础语法、装饰器、上下文管理器 > 阅读收益:掌握 Python 所有并发方案的底层原理、选型标准和生产级避坑指南--- 第一章:核心概念与术语 1.1 并发(Concurrency)vs 并行(Parallelism)| 概念 | 定义 | 硬件要求 ||-----
Edit
2026-07-05 · 27 分钟阅读 · 47 次阅读 · Python
Pandas 系统整理
Pandas 系统整理适用场景:结构化表格数据的 ETL 及常规数据分析。阅读方式:先看全景图建立心智模型 → 快速上手跑通全流程 → 按需深入分层详解。--- 一、数据流全景图mermaidflowchart LR %% 定义样式 classDef io fill:fff3e0,stroke:e65100,stroke-width:2px classDef core fill
Edit
2026-06-30 · 16 分钟阅读 · 81 次阅读 · 数据分析
Spark SQL 用法手册
Spark SQL 用法手册> 适用场景:日常写 Spark SQL 多、PySpark 少的数据开发岗位。纯 SQL 语法、带测试数据、每类方法说明用法并展示运行效果。>> 环境:Spark 3.x,使用 spark.sql() 执行。以下所有示例在 Spark Thrift Server 或 spark-sql CLI 中也可直接运行。 优秀资料分享[Spark SQL 函数分类导航](ht
Edit
2026-06-29 · 40 分钟阅读 · 78 次阅读 · 数据分析
Spark SQL 内核精解:三层架构视角下的全链路拆解
Spark SQL 内核精解:三层架构视角下的全链路拆解> 适用读者:有一定大数据开发经验,但希望深入理解 Spark SQL 内部原理的数据工程师、数据平台开发人员。>> 阅读方式:本文采用逐层递进的结构——每章只引入该层的新概念并配模块图,最后一章才拼出完整全景图。建议顺序阅读,不要跳读。>> 全文线索:跟随一条 SELECT DISTINCT(query) FROM query_table
Edit
2026-06-28 · 7 分钟阅读 · 86 次阅读 · 数据分析
统计建模-假设检验和回归分析
假设检验 和 回归分析 假设检验:判断差异是不是"真的" 核心问题你观察到 CTR 从 12% 变成 13%,这1%的提升到底是排序策略真的有效,还是纯粹随机波动?任何指标天天都在波动,哪怕什么都没变,今天12.3%明天11.8%都很正常。假设检验要解决的就是:怎么判断"看到的差异"够不够大,大到不能用随机波动解释。 为什么能做到——背后的逻辑链 第一步:假设"什么都没变"(零假设)零假设 H
Edit
2026-06-23 · 26 分钟阅读 · 69 次阅读 · 中间件
Docker 深度指南:从部署博客到理解容器
Docker 深度指南:从部署博客到理解容器> 这不是一本"命令大全",而是一条从真实困境出发、逐层剥开的认知路径。> 每个概念都在你问"为什么"的时候才出现,每个流程图都试图把一个抽象机制说清楚。--- 引子:我的博客,三个环境的三种命运你写好了一个博客——Python + FastAPI,本地 uvicorn app.main:app 跑得飞起。准备上线了:开发机 (Python 3.12)
Edit
2026-06-23 · 18 分钟阅读 · 82 次阅读 · 后端
反爬虫与安全防护体系 — 设计手记
反爬虫与安全防护体系 — 设计手记> 从一次自主发起的防护评估开始,到逐条分析威胁、否定不合适的方案、落地真正有效的防护,最终形成一个分层反爬体系。本文档完整记录了决策过程、取舍理由和架构设计。--- 一、为什么需要反爬——威胁分析在实施任何防护前,需要先清点被保护对象的资产价值。不同资源被爬取的后果差异很大,统一防护等级会导致过度设计或防护不足。 1.1 资源分级| 资源
Edit
2026-06-23 · 11 分钟阅读 · 76 次阅读 · 复盘
部署数据丢失事故复盘
部署数据丢失事故复盘> 一次 deploy-update.sh 执行后博客文章"全部消失"的排查与修复记录。>> 从现象到根因一共四层下钻:确认挂载 → 发现两份 db → 路径不匹配 → DATABASE_URL 格式错误。每一层的排查命令和判断依据都有记录,可作为类似问题的快速定位参考。--- 一、前置背景 1.1 这个项目是怎么部署的项目使用 Docker 部署,有两套部署脚本:deplo
Edit
← 上一页 2 / 3 下一页 →
标签
#055 #Alpine.js #ChromaDB #FastAPI #Jinja2 #Redis #SQLAlchemy #SQLite #docker #fastapi #panda #pyspark #spark #sparksql #transformer #一致性 #中序 #二叉树 #假设检验 #前序 #动态规划 #后端开发:Python(FastAPI/Flask)、RESTful API设计、并发编程(ThreadPoolExecutor、asyncio)、任务调度、Docker #后续 #回归分析 #回溯 #多级缓存 #存储与中间件:MySQL、Elasticsearch、Redis、DMQ #学习记录 #尼米兹航母 #并发 #开发规范 #异步 #投资 #数据/AI工程:SparkSQL(熟练)、Pandas、FineBI、sentence-transformers、- Prompt Engineering(Few-shot/CoT) #数据一致性 #数据处理 #新能源 #模拟面试 #汽车 #滑动窗口 #爬虫 #环境搭建 #统计建模 #股票 #设计 #设计模式 #迭代 #递归 #通用工具:Linux、Shell、Git #面试复盘
© My Personal Blog RSS · 管理