레이블이 회고인 게시물을 표시합니다. 모든 게시물 표시
레이블이 회고인 게시물을 표시합니다. 모든 게시물 표시

2022년 12월 31일 토요일

2022년 회고

 올해는 블로그 포스팅을 열심히 못했다. 개인적으로 지금까지 경험했던 내용들을 리마인드하자는 마인드로 한해를 보낸 것 같다. 

대부분의 시간을 MLOps pipeline 구축하고 대부분을 최적화 하는데 시간을 많이 할애했다. 결국에는 MLops도 데이터엔지니어링의 한 부분이라고 생각이 들고 기존에 수집-저장-가공-처리 부분에서 가공-처리 부분에 속하는 부분이지 않을까 생각이 든다. 


SSG.COM에서 현대카드로 이직한지 2년 정도가 되었는데 확실히 금융권과 e커머스와는 분위기가 많이 다르지만 배울 부분도 많았다. 그리고 기술스택이나 개발의 자율성보다 제일 중요한 것은 역시 좋은 사람들과 일하는 것이고 만족하게 한해를 보냈다. 그리고 개발적인 부분은 할 수 있는 부분 안에서 내가 어떻게든 새로운 걸 찾아서 한다면 꾸준히 성장 할 수 있다고 생각한다.


결론은 올해는 리마인드의 해였다면 내년에는 새로운 것을 찾아서 재밌는 일들을 해봐야겠다. 2023년 계묘년도 화이팅해보자.


블로그 조회수는 포스팅이 없어서 유지만 되고 있다. 내년에는 포스팅 좀 열심히 해봐야겠다.

2021년 12월 31일 금요일

2021년 회고

2021년은 이직을 하면서 조금 바쁜 해를 살았다. 새 회사와 도메인에 적응하기 위해 나름 바쁘게 살았고 기존에 알던 지식을 어떻게 사용할 수 있을지 많이 고민을 했었다. 결과적으로는 기술부채를 많이 쌓았지만 경험적인 측면에서는 많이 도움이 되었던 것 같다.


올해 포스팅은 대단한 것을 쓸 기회가 없었을 것 같았기 때문에 개인적으로 그 동안 알고 있던 내용을 정리하는 시간을 갖고자 했다. 데이터 엔지니어가 알아야할 기본적인 내용을 시리즈별로 작성했다.


1) 빅데이터 플랫폼 아키텍처에 대하여.. 데이터 스토리지 관점에서의 흐름
https://parksuseong.blogspot.com/2021/06/1.html
2) 빅데이터 플랫폼 아키텍처에 대하여.. 하둡을 알아보자
https://parksuseong.blogspot.com/2021/08/2.html
3) 빅데이터 플랫폼 아키텍처에 대하여.. 데이터를 처리를 위한 Spark
https://parksuseong.blogspot.com/2021/08/3-spark.html
4) 빅데이터 플랫폼 아키텍처에 대하여.. 배치 스케쥴러(airflow, azkaban, oozie)
https://parksuseong.blogspot.com/2021/08/4-airflow-azkaban-oozie.html
5) 빅데이터 플랫폼 아키텍처에 대하여.. 데이터 시각화를 위한 프레임워크(DashBoard 구현에 필요한 Grafana, Prometheus, influxDB 등)
https://parksuseong.blogspot.com/2021/08/5-dashboard-grafana-prometheus-influxdb.html
6) 빅데이터 플랫폼 아키텍처에 대하여.. 다른 팀과 협업 시 구성하면 좋은 프레임워크(hive, hue)
https://parksuseong.blogspot.com/2021/10/6-hive-hue.html


원래 기술블로그를 보면서 의견이 있어도 댓글을 안달고 그냥 머리속으로 끝냈는데 포스팅을 하다보니 댓글 하나하나가 큰 힘이되고 다시 생각을 정리하는 시간도 갖게되어서 댓글을 달아주신 분들이 너무 감사하다는 생각이 들었다.

특히 전 직장에서 기술적으로 많이 도움을 주셨던 장원주 담당님이 의견을 남겨주셔서 큰 힘이 되었고 댓글이 큰 힘이 되는 것을 알았기 때문에 나도 다른 블로그글들을 보면 댓글을 남겨야겠다고 생각을 했다.(SSG.COM 장원주 담당님 감사합니다.)


2021년은 코로나때문에 스스로도 많이 나태해졌고 무언가 열심히 찾아보고 새로운 방법을 찾아보려고 한 것이 없다는 것이 너무 아쉬운 한해가 되었다. 그나마 가장 열심히(?) 방법을 찾아보려고 했던 것이 있다면 airflow dynamic task at runtime인데 이 부분도 포스팅을 했는데 같은 어려움을 겪으면서 고민을 해 주신분이 계셨고 댓글을 남겨주셔서 감사했다.

해당 포스팅은 airflow dynamic task at runtime에 대한 고찰이며 같은 결론에 도달한 것이 다행이기도 하지만 아쉽기도 하였다.

( https://www.blogger.com/blog/post/edit/7933278769949015036/5051160839575531588 )


생각해보면 100% dynamic batch flow를 들어본 적도 본 적도 없기는 하다.


블로그 조회수



내년에는 쓸 것을 찾아서 더 열심히 써야겠다. 개인적으로 데이터 쪽이나 사이드 프로젝트를 진행하며 꾸준히 포스팅할 소스를 찾아볼까 한다.

아무튼 2022년에는 더 재밌는 일이 찾아오기를 바란다!

2020년 12월 31일 목요일

2020년 회고

2020년 올해는 기술적으로 이것 저것 많이 시도해봤다. 

데이터엔지니어로서 데이터를 다루는 것도 중요하지만 데이터를 수집하고 저장하고 처리하는 구조를 만드는 일이 더 중요하고 어려운 일이라고 생각하기 때문에 이 부분을 공략하는데 주력했던 것 같다. 또한 한번 만들어놓은 구조는 쉽게 바꾸지않기 때문에 다뤄볼 기회가 적은 것도 사실이다.

1분기 쯤에는 카산드라 클러스터에 ZING GC를 도입하기 위해 여러 테스트를 해봤다. G1GC, CMS GC 등 여러 GC를 비교해보고 결국 ZING을 선택했고 국내에서는 최초로 카산드라+ZING 조합의 레퍼런스가 되었다.

2분기 쯤에는 Spark+Cassandra조합으로 memtable을 헤비하게 사용하다가 결국 장애를 발생했고 sstable로 전환하는 작업을 진행했다. 한번에 성공한 것은 아니고 하나를 고칠 때 마다 네트워크장애, 디스크 장애가 순차적으로 발생하여 하나하나 들여다보는 계기가 되었다. 결국 수 많은 시행착오 끝에 꽤 괜찮게 최적화를 했고 분산환경에서 배치시간이나 성능이슈를 해결하는 노하우가 생겼다.

3분기 쯤에는 추천시스템의 A/B Test를 자동화할 수 있는 궁극기(?)인 MAB(Multi Armed Bandit)을 적용하고 싶었다. 여러 자료를 찾아보고 결국에는 도메인으로 풀어야한다는 생각을 개인적으로 했다. 먼저 데이터 수집이 안되고 있었기 때문에 kafka, logstash로 먼저 데이터를 수집했고 이후 Spark Batch로 필요한 데이터를 연산까지는 했지만 결국은 적용하지는 못했다.

4분기 쯤에 가장 기억나는 일은 2020 Data Conference에서 발표를 했던 일이다. 많은 분들이 도움을 주셨고 팀원분들과 Azul Systems 대표님께 감사하게 생각하고 있다.

그리고 아직 진행 중이기는 하지만 거의 마무리가 된 일 중에 하둡2에서 하둡3으로 업그레이드하면서 하둡, 메소스, 스파크 클러스터를 새로 구축하고 아즈카반을 활용한 배치를 모두 옮기면서 전체적인 구조를 다시 한번 생각해보게 되었다. 시스템 분들의 도움을 많이 받아서 중구난방인 디스크 배치도 다시 잡고 Raid 구성도 서버의 역할마다 다르게 세팅하고 재밌었다.

2020년은 빅데이터 플랫폼을 구성하는 각각의 프레임워크를 조금 더 깊게 다뤄보고 안쓰는 기능도 도입하기 위한 테스트 해보고, 설계도 해보면서 꽤 재밌었다.

블로그도 2019년에 비하면 꽤 올랐다.


하둡 3.1.2는 그냥 집에서 개인적으로 설치한 건데 생각보다 조회수가 많다. 내년에는 프로덕션 환경에서 적용할 수 있는 HA 구성까지 한 3.1.4 버전으로 많이 유입이 되었으면 좋겠다.



아무튼 2021년에는 더 재밌는 일이 찾아오기를 바란다.

2020년 1월 1일 수요일

2019년 회고

블로그를 하면서 회고록을 한번 써봐야겠다 싶었는데 생각보다 쓰려고 하니 낯뜨겁다..
하지만 언젠가 내 과거의 글들을 보면서 여러가지 생각을 해보기 위해 기록을 남긴다.

2019년은 나에게 있어서 큰 터닝포인트가 될 것이라고 생각한다. 


먼저 업무적으로 2016년부터 DW일을 하다가 빅데이터 일을 하게 되었는데 기술적인 부분 뿐만 아니라 데이터적+개발적으로 큰 시야를 갖게 되었다. 다뤄보지않는 여러 오픈소스들, 그리고 카산드라나 모니터링툴을 도입하는 과정을 통해 많이 생각하고 배울 수 있었다. 아무튼 이런 기회를 준 분들께 감사드리고 더 많은 연구를 해보고 싶다.


2년전에 내가 어떤 커뮤니티에 대학원에 대해서 글을 올렸더라. 2년 후에는 어떤 방식으로든 대학원에 가서 더 배워보고 싶다고.. 그런데 올해 그 발언을 실현하게 되었다. 빅데이터, AI 전공이고 제대로된 논문을 써보고 싶다. 대학원을 병행하는게 쉬운 일은 아니지만 재밌는 만큼 보람이 있다.


공모전에서 상을 탔다. 통계청에서 주관한 SGIS 공모전인데 24점 출품작 중 9점 안에 뽑혔다. 뉴스에도 나왔다. 주도적으로 한 작업이기에 나름 애착이 갔던 작품이고 대략 매출+인구통계를 지도에 표현하는 것으로 이 작업을 하기 위해 크롤링, 좌표 폴리곤 합성, 인구 통계 데이터 가공 등을 연구하고 경험했다.



링크 
작품내용 : 통계청


마지막으로 월 3회 기술 포스팅을 목표로 했었는데 이것도 나름대로 잘 지켰다.
블로그 자체에 큰 의미를 두는 것은 아니지만 스스로 약속을 지키기 위해 무언가를 꾸준히 하게 된다는 점에서 의미가 있었다고 생각한다.

PV가 꾸준히 증가하긴 하더라..

가장 많은 조회수를 기록한 글.. 생각보다 mssql 글이 많다.




가장 애착이 간 글 몇개만 뽑아보자면..

아무래도 하둡 3.대가 나온지 얼마 안되서 관련 자료도 없고 요즘 ambri 같은 걸로 설치하니 맨땅에 헤딩하듯 설치하는 글들이 별로 없어서 많이 들어왔던 것 같다.
이건 나중에 공모전에도 출품해서 상 받은 내용이기도 하고.. 자료가 없어서 처음부터 끝까지 퇴근 후에 집에서 연구를 해와서 회사서 바로 적용할 수 있게 했던 추억이 새록새록..
DW와 빅데이터 양쪽을 경험해보고 생각을 정리했던 글이다.

아무튼 카산드라 모니터링 툴, 카산드라 gc 테스트 등 다 애착이 가는데 그냥 바로 생각나는 것을 적어봤다.



2019년 이것 저것 실수한 것도 많았고 배운 것도 많았다.

2020년 올해는 해보고 싶은 것도 많고 업무적으로도 스파크 스트리밍 등 여러가지 난이도 있는 일도 계획되어 있고.. 학업적으로는 논문도 좀 읽어보고 내 논문도 준비하고.. 여러가지로 바쁠 것 같다.

2019년 여러 가지로 감사한 분들이 많았고 2020년도 화이팅하자.

2022년 회고

 올해는 블로그 포스팅을 열심히 못했다. 개인적으로 지금까지 경험했던 내용들을 리마인드하자는 마인드로 한해를 보낸 것 같다.  대부분의 시간을 MLOps pipeline 구축하고 대부분을 최적화 하는데 시간을 많이 할애했다. 결국에는 MLops도 데이...