周凯的头像
🎓 福州大学 · 数据科学与大数据技术 · 在读

你好,我是 周凯
正在把「会写代码」升级成「能做工程」

方向:大数据开发 / 数据工程。喜欢把重复劳动写成脚本,也喜欢把「能跑」打磨成「能维护、能协作、能交付」。

Python 数据采集 / 爬虫 SQL Flask pandas Spark(在学) 自动化工具链
ABOUT ME

关于我

一个相信「长期主义要写进日程表」的大数据专业学生。

👋 自我介绍

我是福州大学数据科学与大数据技术专业的在读学生,目前主修《数据采集与融合》《软件工程与软件工程实践》等课程。 这个学期我给自己定的主线是:把零散的编码能力,组织成能交付的工程能力

技术上我目前以 Python 为主,能独立完成数据采集脚本、后端接口和自动化工具; 专业主线方面,我正在从「会采集数据」往「能处理大规模数据」推进—— Hadoop / Spark / Hive 这套生态,是我接下来两年要打穿的核心

课余时间我健身、拍照、折腾工具。这三件事看起来不相关,其实都在训练同一种能力—— 把一件复杂的事拆成可重复执行的步骤

我理解的工程能力:把「能跑」变成「能维护、能协作、能交付」。

📋 基本信息

  • 学校福州大学 · 数据科学与大数据技术
  • 方向大数据开发 / 数据工程
  • 主语言Python(在学 Java)
  • 累计代码约 3,000 行(课程开始至今)
  • 学期目标15,000 行,且带单元测试
  • 当前在做数据采集与融合课程实践
  • 坐标中国 · 福州
SKILLS

技能树

按真实掌握程度打分,不虚高——列出「会用」和「还没学会」同样重要。

Python 编程熟练
数据采集 / 爬虫熟练
Flask Web 后端会用
HTML / CSS / JS会用
AI 接口集成 & Prompt上手
自动化脚本 / 工具链熟练
数据结构与算法薄弱
数据库与 SQL在学
Git 团队协作在学
单元测试 / CI几乎为零
pandas / 数据清洗在学
Linux / Shell在学
Hadoop / HDFS待学
Spark / PySpark待学
Hive 数据仓库未接触
Flink 实时计算未接触
🌱 本学期在学
数据结构与算法 数据库系统原理 软件工程全流程 Linux 与 Shell Git 分支与 PR
🧊 大数据专业核心栈(本专业主线)
Python 数据处理 pandas SQL 多表关联 / 窗口函数 Hadoop / HDFS 集群 Spark / PySpark 批处理 Hive 分层建模 ODS/DWD/DWS Flink 实时计算 调度系统 Airflow / DolphinScheduler
🎯 待攻克(诚实清单)
算法题手感 Hadoop/Spark 生态实战 数据仓库分层建模 索引与慢查询优化 面向对象设计 / 设计模式 单元测试与 CI 计算机网络底层 阅读开源源码
PROJECTS

实践经历

三个真实跑通的项目,都有可复现的运行记录,不是「看起来跑通了」。

PROJECT 01

🕷️ Python 爬虫与环境搭建

从零配置 Python 隔离环境,用 urllib 手写 GET / POST / GET+POST 混合请求, 并自建 Flask 站点做端到端验证;实现正则抽取标题与链接的迷你爬虫。

PythonurllibFlask正则
📈 约 1,000 行 · 含 18 张运行截图
PROJECT 02

🎨 AI 文生图交互实验台

对接图像生成 API,做出「输入提示词 → 调参 → 实时出图」的网页实验台。 用 v1→v2→v3 三轮提示词迭代,验证结构化提示词与摄影参数对真实感的影响。

FlaskJavaScriptREST APIPrompt
📈 约 1,100 行 · 3 条真实 API 调用日志
PROJECT 03

🧰 自动化交付工具链

把「截图 → 加水印 → 排版成文档」整条流程脚本化:Playwright 调本机 Edge 渲染截图、 PIL 叠加斜向水印、python-docx 自动排版。三次作业复用同一套脚本。

PlaywrightPillowpython-docx
📈 约 1,000 行 · 节省大量重复劳动
SELF ASSESSMENT

自我评估:我会什么,我不会什么

了解自己会什么、不会什么,是进步的起点。左栏是底气,右栏是本学期的攻坚清单。

✅ 我确定自己会的

  • 环境搭建:从零配置 Python 隔离环境并管理依赖
  • 网络请求:urllib / requests 发 GET、POST、混合请求,处理编码与异常
  • 后端接口:用 Flask 起带表单、JSON 接口、能返回图片的本地服务
  • 数据解析:正则 + BeautifulSoup 抽取网页内容并落盘
  • 数据清洗:pandas / NumPy 做去重、缺失值处理与聚合统计
  • AI 接口:处理鉴权、参数、响应与错误,并记录调用日志
  • 自动化:把重复劳动写成脚本(截图、水印、文档生成)
  • 技术写作:用 Markdown 写清楚一篇实验记录

❌ 我现在还不会的

  • 算法:只会暴力解,刷题量几乎为零
  • 大数据生态:Hadoop / Spark / Hive 只闻其名,没搭过集群没跑过作业
  • 数据仓库:分层建模(ODS/DWD/DWS)、指标体系没概念
  • SQL:只会基础 CRUD,多表关联与窗口函数写不利索
  • 设计能力:拿到需求直接写代码,画不出类图时序图
  • 协作:没用 Git 和别人协作过,不懂 PR 与 Code Review
  • 测试:几乎不写单元测试,靠手动点一遍
  • 底层:计网与操作系统只停留在课本
ROADMAP

未来三年规划:走就业路线

我选择就业作为主线。理由很直接:我喜欢「做出能被别人用的东西」这个过程,想尽早用真实项目的复杂度倒逼成长; 同时我的算法与底层基础目前偏弱,直接冲考研风险收益不成正比。 这不是放弃深造,而是先把工程手感扎稳——读研可以以后做,手感只能靠项目堆出来。

第 1 年 · 打地基

把短板补齐,把专业栈立起来

核心:基础能力 + 大数据生态入门

  • 算法:LeetCode 200+ 题,覆盖数组 / 链表 / 树 / 图 / DP
  • 数据库:学完原理,能写多表关联与窗口函数,能设计含索引与事务的业务表
  • 大数据生态:搭起 Hadoop/HDFS 伪分布式环境,用 PySpark 跑通批处理作业
  • 协作:用分支 + PR + Review 完整参与一个多人项目
  • 量化目标:期末代码量 15,000 行,且带单元测试
第 2 年 · 做深度

走通数据全链路,拿到实习

核心:数据全链路 + 真实研发流程

  • 项目:交付 2 个数据全链路项目(采集 → 清洗 → 入仓 → 分析 → 可视化)
  • 数据仓库:学 Hive 分层建模(ODS/DWD/DWS),独立出一个主题域的指标体系
  • 实时计算:切入 Flink,做一个「批流一体」的小项目
  • 实习:拿到第一份数据开发实习,走完需求评审 → 开发 → 联调 → 上线
  • 量化目标:累计代码量 30,000 行,参与 Review 30+ 次
第 3 年 · 收成果

秋招冲刺与沉淀

核心:复盘输出 + 拿到 offer

  • 复盘:完成 3 轮系统性复盘(算法、大数据八股、项目)
  • 目标:拿到大数据开发 / 数据工程方向的校招 offer
  • 毕设:做一件自己真正想做的事,而不是「为了毕业而做」
  • 量化目标:累计代码量 50,000 行
衡量标准不靠感觉,靠数字:代码行数、可运行项目数、算法题数、Code Review 参与次数。
INTERESTS

兴趣爱好 & 一段想分享的经历

🏋️

健身

和写代码很像——没有捷径,只有周期、复现和耐心。连续三年每周三次,教会我「长期主义」不是口号而是日程表。

📷

摄影

这直接影响了我做 AI 图像作业时的判断标准——我能一眼看出一张生成图「假」在哪:皮肤没毛孔、光线方向不一致、虚化不符合光学规律。

🧰

折腾工具

从截图水印脚本到自动排版工具,我享受「一个动作重复三次 → 就把它写成脚本」的过程。

💡 印象最深的一次踩坑

做 AI 图像作业时,本机无法直连 Hugging Face,平台上的目标模型又恰好下架。 我没有停在「环境不支持」,而是排查了代理、镜像、替代平台的可用性, 最后换用同源模型完成端到端验证,并在报告里如实写清了切换原因。

那次我学到:工程师的价值不在于「环境完美时能跑通」,而在于「环境不完美时还能交付」。