Joe

Java 后端开发 · 全栈工程能力
双 AI 引擎票据解析系统、Spring Boot 全链路性能调优(QPS 百级→千级)、自研 RAG+Agent 混合检索平台。78 篇原创博客沉淀完整技术成长路径。
📧 1665637752@qq.com
🐙 github.com/joeplover
📝 www.ploverjoe.xyz
求职意向:Java 后端开发 · 数据科学与大数据技术专业背景,具有从零构建生产级 AI 系统的完整工程能力。两段实习经历:悟空共创(腾讯元器 + FastAPI MCP Server 全栈开发,PR 合并至主分支)、霞辉人工智能(70万+ 数据清洗 + ES 全文搜索重构)。熟悉 Spring Boot / FastAPI 双栈开发、LangGraph 多智能体编排、RabbitMQ 异步消息、Redis 幂等控制及系统性能调优,能独立负责模块设计到部署的全流程。
核心项目
CheckByAI · AI 物流票据智能解析平台 2026.04
Spring Boot 3 + LangGraph 双 AI 引擎 · 物流单据自动化审核
架构: Vue 3 → Spring Boot 3 → RabbitMQ 异步分发 → Coze 工作流 / LangGraph 4 节点管线 → PaddleOCR + DeepSeek 校验
S(背景):物流行业装卸货磅单长期依赖人工审核,效率低且易出错——每单核对需 10-15 分钟,人工成本高且数据易篡改。
T(目标):构建自动化票据解析系统,实现「上传 Excel 磅单 → AI 自动识别 → 数据一致性校验」全流程无人化,目标单条票据处理时间 <30 秒。
A(行动):采用 Coze 低代码 + LangGraph 双 AI 引擎架构——Coze 可视化编排实现票据数据预处理(运营人员可维护解析流程);LangGraph 编排 4 节点 Agent 管线(Coordinator 拆解 → Excel Agent 提取字段 → PaddleOCR Agent 识别图片 → DeepSeek 校验 Agent 对比一致性)。设计 RabbitMQ 死信队列异步分发(消费失败自动重试 3 次后转入人工审核台),Redis 三层幂等控制(分布式锁 → Token 标识去重 → DB 唯一索引兜底)。
R(结果):单条票据处理时间由 10-15 分钟降至 <30 秒,审核效率提升 20 倍+。RabbitMQ 死信兜底 + Redis 幂等保证零重复处理。完整设计文档 + 架构图沉淀为博客。
自省:从单一 LLM 调用到多 Agent 编排的思维转变,学到 Agent 间状态传递的设计模式(共享 Context 对象 + 子任务结果回写)。双引擎取舍——低代码适合流程编排(运营可维护),LangGraph 适合复杂推理(多 Agent 协作)。
Java 17Spring Boot 3PythonLangGraphCozePaddleOCRDeepSeekRabbitMQRedisVue 3
Java_Online · Spring Boot 生产环境性能调优 2026.06
全链路压测 · 2 核 4G VM 极限优化 · QPS 百级→千级
架构: JMeter 压测 → Nacos 配置中心 → Spring Boot (Tomcat + HikariCP) → MySQL → Nginx → 2C4G VM
S(背景):2 核 4G 低配 VM 上运行的 Spring Boot 生产应用,P95 响应时间高达 4 秒,无法支撑日常流量。
T(目标):系统性定位瓶颈并优化,目标 QPS 从百级提升到千级,P95 降至 1 秒以内。
A(行动):按"现象→猜测→验证→优化"四步递进排查。第一层开启 MySQL 慢查询日志 + EXPLAIN 分析,发现缺少联合索引导致全表扫描,加索引后 P95 2.8s→1.2s。第二层观察 Tomcat 线程池活跃线程达 200 上限,调大 server.tomcat.threads.max=1000 + accept-count=500,P95 降至 0.6s。第三层 HikariCP 连接池默认 10 太小(200 线程争夺 10 连接),调至 maximum-pool-size=50,P95 降至 0.4s。第四层 Nacos 客户端长轮询在高并发下 CPU 飙高,优化长轮询超时 + 降采样,Nginx worker_connections 从 512→1024。
R(结果):最终 QPS 从百级稳定到 千级,P95 从 4s 降至 400ms,优化 10 倍。完整调优过程及压测数据记录为博客,形成可复用的服务端性能调优方法论。
自省:调优不是玄学,是逐层拆解的工程问题——数据库→线程池→连接池→中间件,每层都有可测量的瓶颈指标。学会 Nacos 客户端调优参数和 JMeter 压测脚本编写。
JavaSpring BootJMeterNacosNginxHikariCPMySQL
BigGraph · RAG + Agent 混合检索平台 2026 持续
自研 RAG 平台 · 双路召回 + LangGraph Agent 编排
架构: 文档解析 → Qdrant (向量) + ES (关键词) 双路召回 → LangGraph Agent 编排 → LLM 生成
S(背景):企业文档搜索长期面临"关键词搜不到语义相关内容"的痛点——传统 ES 全文搜索无法理解"今年预算批复"和"2025 财年审批额度"是同一概念。
A(行动):构建双路召回架构——文档分块后经 embedding 模型存入 Qdrant(语义检索),同时保留 ES 全文索引(关键词精确匹配),查询时双路召回 + 分数归一化融合(Min-Max 归一化后加权平均,向量 : 关键词 = 0.7 : 0.3)。Agent 层用 LangGraph 构建有状态编排,支持工具注册中心(@register_tool 装饰器 + Pydantic schema 自动描述)、智能路由、滚动记忆窗口(Token 超限自动调用 LLM 压缩为摘要)。
R(结果):双路召回相比纯 ES 语义召回率提升 30%+。Agent 工具注册中心支持 6 种工具动态绑定,记忆窗口机制保证 50 轮以上长对话不溢出。封装为 FastAPI 统一查询接口(支持检索/流式/引用溯源三种模式)。
自省:学到分数归一化的实际调参经验(不同语料权重不同),以及 RAG 系统中 Agent 层 vs 检索层的职责边界划分。记忆窗口的 token 压缩策略对长会话效果影响显著。
PythonLangGraphFastAPIQdrantElasticsearchDockerPydantic
AI 招标数据清洗管线 · 80 万数据优化 2026.03
全自动化数据管线 · MariaDB → Python 清洗 → LLM 提取 → ES 检索 → 分析报告闭环
架构: MariaDB → Python 清洗管线 → LLM (Qwen2.5) 提取 → ES 索引 → FastAPI → ECharts 看板
S(背景):招投标行业数据分散在多个网站,关键字段(公司名、金额、日期)以非结构化文本形式存在,正则表达式提取准确率仅 60%+。
A(行动):从旧表抽取 80 万条招标公告,Python 管线清洗去重。设计 few-shot prompt 模板引导 Qwen2.5 输出结构化 JSON(92%+ 准确率),正则后处理补漏兜底。ES 索引设计 ngram + ik 分词器,替代 MySQL LIKE 模糊查询。独立解决裸机 GPU 环境搭建(NVIDIA 驱动 535→550 版本冲突 → 降级后 CUDA 不可用 → 重装驱动 + 重构 nvidia-container-toolkit 容器运行时)。
R(结果):成功清洗 70 万+ 条数据,LLM 提取准确率 92%+。ES 全文搜索替代 MySQL LIKE,查询性能提升数十倍。GPU 环境搭建踩坑过程形成可复用的搭建指南。
PythonFastAPIElasticsearchOllamaGPUStackDockerCUDAQwen2.5
Custom Game Platform · 在线游戏编辑器 2026.06
全栈独立开发 · pnpm monorepo · Pixi.js 8 引擎 · Next.js 14 编辑器
架构: pnpm monorepo → packages/{engine, editor, shared} · TypeScript 全栈
从零搭建 pnpm monorepo 多包架构,实现浏览器端从关卡设计到实时试玩的完整工具闭环。引擎层实现波次刷怪、AABB 碰撞检测(swept AABB 解决鬼穿墙)、武器系统、音效池(Web Audio API 动态混音)。编辑器层实现 Canvas 实时预览 + Zundo 命令模式 undo/redo、属性/图层面板双向绑定、关卡 JSON 导入/导出。
  • 碰撞分离方向歧义 → 引入 MTD 算法按重叠深度最小轴分离
  • Web Worker 预计算光照和寻路网格,保证编辑主线程不卡顿
TypeScriptNext.js 14Pixi.js 8Drizzle ORMPostgreSQLZustandpnpm
实习经历
AI 应用开发实习生(远程) · 悟空共创 U3W-AI 开源项目组
2025.11 - 2026.01
  • 基于腾讯元器低代码平台搭建多步骤文档解析工作流(上传→格式识别→内容提取→结构化输出),结合 Apache Tika 服务端解析解决 PDF/Word/Markdown 等多格式兼容,非技术人员可维护解析流程
  • 实现"上传文档 + 自然语言提示词"的特定内容提取功能:预定义提示词模板 + 字段映射配置,将用户指令自动转化为解析参数
  • 基于 FastAPI + SSE 独立开发 MCP Server(Model Context Protocol),打通大模型与文档解析引擎的通信链路:设计异步回调机制解决工作流长耗时任务的阻塞问题(启动→task_id→SSE 推送进度→完成回调),PR 合并至项目主分支
  • 沉淀:低代码自定义节点开发模式、MCP 协议工具注册/调用/结果回写的通信模型、异步工作流状态管理
后端开发实习生 · 霞辉人工智能
2026.03 - 2026.04
  • AI 数据清洗管线:设计 Python + Qwen2.5(Ollama 本地部署)的混合提取方案——few-shot prompt 引导模型输出结构化 JSON → 正则后处理补漏 → 人工抽检校准。成功清洗 70 万+ 条 MariaDB 业务数据,提取准确率 92%+
  • ES 全文搜索重构:设计 ngram + ik 分词器索引结构,将 MySQL LIKE 模糊查询全部迁移至 Elasticsearch,查询性能提升数十倍。实现 binlog 监听 + 定时全量补偿的增量同步机制保证 MySQL ↔ ES 数据一致性
  • 动态分表:针对单表 70 万+ 数据,设计按日期分片(每半年一张表),查询路由层按时间范围匹配表再执行
  • GPU 环境搭建:独立解决裸机 NVIDIA 驱动版本冲突(535 vs 550 兼容性 → 升级驱动 + 重构容器运行时),恢复 GPU 算力保障本地大模型稳定推理
  • 沉淀:ES 分词器选型对中文搜索效果的影响、LLM 提取 vs 传统规则提取的优劣边界、GPU 驱动/CUDA 版本兼容性矩阵排查方法
技术栈
后端 Java (Spring Boot/Cloud, MyBatis-Plus, JPA), Python (FastAPI, LangGraph, Flask), Node.js (Next.js, Express)
前端 React 18 / Next.js 14, Vue 3, TypeScript, Tailwind CSS, Pixi.js 8
中间件 Redis, RabbitMQ, Kafka, Nacos, Nginx, ZooKeeper, HikariCP
AI / 检索 LangGraph, Qdrant, Elasticsearch, Milvus, RAG, Coze, PaddleOCR, Ollama, DeepSeek
数据 / 运维 PostgreSQL, MySQL, SQLite, Docker, Hadoop/Spark, GPUStack, JMeter
工具 / 协议 Git, pnpm, Prisma, Drizzle ORM, JWT, OAuth2, WebSocket, SSE, MCP, 腾讯元器, Coze
教育背景
赤峰大学 数据科学与大数据技术 · 本科
2022.09 - 2026.06
相关课程:数据结构与算法、数据库原理、操作系统、计算机网络、大数据技术原理、数据挖掘、机器学习、分布式计算(Hadoop/Spark)
技术博客
www.ploverjoe.xyz · 78 篇原创技术博客,覆盖 Spring Boot 调优、RAG 系统构建、GPU 环境搭建、AI Agent 开发等实战内容。最高单篇阅读量 1500+。博客坚持"真实项目 + 具体数据 + 踩坑记录"的写作风格,每篇文章都包含可复用的代码片段或配置方案。