-
x-Learning데이터 2025. 1. 19. 23:02
머신러닝 공부하면서 맨 먼저 접하게 되는 단어가 지도학습(Supervised Learning), 비지도학습(Unsupervised Learning) 이란 단어일 것이다. 불과 얼마 전까지만 해도 지도학습, 비지도학습, 강화학습 등 학습방법의 종류가 그렇게 많지 않았다. 하지만 생성형 AI들이 큰 흐름을 형성하고 있는 최근 책이나 논문을 읽다 보면 접해보지 못했던 새로운 AI 학습 방법에 대한 용어들이 많이 등장한다. 이번 글은 각종 머신러닝 학습 방법과 개념을 포괄적으로 정리하여 필요할 때 참조할 수 있도록 정리하는 글을 작성한다. 여러가지를 한번에 통칭해서 표현할 때, x 라는 말을 사용하기에 여기서는 x-Learning 이란 제목으로 AI의 학습 방법과 종류들을 개관해 보기로 한다. 각각의 학습 방법..
-
생성형 AI 관련 몇가지 개념들 정리데이터 2024. 12. 22. 20:05
생성형 AI의 등장바야흐로 생성형 AI의 전성시대이다. 서비스하고 있는 AI의 종류도 많고 특성도 다르다. “어떤 업무에는 어떤 AI가 더 우수하더라”라는 평가도 다양하다. 정도 차이는 있겠지만 이제 chatGPT 같은 AI를 사용하지 않는 사람은 아마 없을 것이다. 최근 AI에 대한 많은 강연과 책을 읽고 있으나, 정확하게 내가 가려운 부분을 시원하게 긁어 주는 내용은 많지 않았다. 그 이유는 강연의 청중이나 책의 독자를 특정하지 않고 막연하게 일반 대중을 상대로 하다 보니 어떤 책은 이미 아는 내용이라 식상하고, 어떤 강연은 지나치게 구체적이고 상세해서 지루하게 느낀 것 같다. 이글은 AI나 머신러닝에 대한 리터러시를 어느 정도 갖춘 사람을 대상으로 생성형 AI의 발전 방향과 새로운 움직임에 대해 몇..
-
생성형 AI와 협업하기데이터 2024. 11. 10. 22:57
LLM 전성시대그야말로 AI 전성시대다, 하루가 다르게 AI의 새로운 모델들이 발표되고, 갈수록 기능이 특화되고 또 다양화되고 있다. 이제 너 나 할 것 없이 한두개 AI는 친숙하게 사용할 수 있고, 업무에도 적극 활용하고 있다. 나만 하더라도 아침에 컴퓨터를 켜고 맨 처음 실행시키는게 GPT 이고 GPT와 인사하며 하루를 시작한다. “AI가 없었던 시절에 어떻게 일을 해었나?”하고 내 생활속에 깊이 들어와 있는 AI에 감사함을 느낀다. 그러면서도 막상 구체적인 업무에서 하고 있는 일을 GPT에게 시키려면 막연하고 어려움을 느끼게된다. 이 글에서는 GPT와 같이 코딩하고 데이터를 분석하면서 느꼈던 경험을 나누고자 한다. 워낙 다양한 상황이 가능하기 때문에 최근에 내가 경험한 일을 중심으로 구제적인 어떤 ..
-
기상분석 II(가시거리 분석)데이터 2024. 10. 27. 22:06
시정(Visibility)과 가시거리까만 물체가 하늘을 배경으로 멀리 지평선 상에 놓여 있다고 하자. 날이 어두워져서 주변 배경이 까맣게 된다면 우리도 더 이상 그 물체를 볼 수 없게 된다. 날이 어두워지는 것 처럼 공기 중에 오염 물질이 많이 섞여 있으면, 하늘색이 불투명하게 되어 가까운 물체도 볼 수 없게 될 것이다. 시정은 관측위치에서 볼 수 있는 거리의 정도를 측정하여 공기가 좋고 나쁜지를 쉽게 판단할 수 있는 척도이다. 시정은 공기 중에 존재하는 대기 오염물질의 종류와 양에 따라 변화가 생긴다. 흐린 날 멀리 있는 물체가 잘 보이지 않는 이유는 대기 오염물질들이 대상 물체에서 반사된 빛을 산란시키거나 흡수하여 눈에까지 도달하지 않기 때문이다. 황사가 심해지는 계절에는 시정이 공기가 얼마나 깨끗한..
-
기상분석 I (바람 분석)데이터 2024. 10. 13. 22:23
바람과 생활바람은 우리 생활에 다양한 영향을 미친다. 풍력 발전 같은 산업분야 뿐만 아니라, 항공기나 선박, 낚시 나 캠핑 같은 취미에 이르기까지 바람이 우리 생활에 미치는 영향은 크다. 이글은 누구나 생활하면서 느끼는 바람에 대한 느낌을 몇 가지 특성으로 가시화 시켜 본 글이다.데이터 수집 및 처리데이터는 기상청이 기상자료 개방 포털(https://data.kma.go.kr/cmmn/main.do)을 통해 제공하는 바람 데이터를 크롤링하였다. 2019년부터 2023년까지 5년 동안 매시간 수집된 바람 측정 데이터 20여만 건을 대상으로 하였다. 참고로 대상 지역은 내가 수행했던 프로젝트에서 지정되었던 지역(파주, 동두천, 철원, 인제, 속초)을 대상으로 하였고, 변수 타입 조정 등 필요한 전처리를 수행..
-
글또 9기를 마치며수필 2024. 4. 28. 21:51
이번 소감은 인터뷰형식으로 작성 봤다. 이를테면 운영진이 내게 몇 가지 질문을 하고 내가 거기에 대답하며 느낌과 의견을 제시하는 형식으로 작성하였다.느낌질문 : 이번 9기 글또가 이전 글또 기수와 다른 점이 있었다면 어떤 것이 있었나요?답 : 저는 7기 8기를 마치고 이번이 세 번째 참여하는 글또였습니다. 개인이 정해진 스케줄에 따라 글을 쓴다는 면에서는 차이가 없었습니다. 다만 7기 때에는 편성된 멤버들이 작성된 글에 대해 서로 리뷰하고 피드백을 주곤 했었는데, 9기에는 큐레이션 제도를 도입하였습니다. 큐레이션에 자발적으로 참여하는 인원을 제외하면 멤버들끼리 각자 작성한 글을 리뷰하고 피드백을 주는 채널이 없어, 글을 쓰기는 부담이 없었지만, 비판적으로 글을 읽는 기회가 없어진 듯한 느낌입니다.좋았던 ..
-
시계열 분석 시리즈 IV (Time Series Toolbox)카테고리 없음 2024. 3. 31. 21:31
시계열 예측 도구 과거 데이터로 올해 매출량을 예측한다고 해보자. 몇 가지 원초적인 방법들이 있을 수 있다. 단순하게 지금까지 평균 매출량 정도 팔릴 것으로 예측하는 방법, 아니면 작년의 매출량 보다는 조금 더 팔릴 것으로 예측하는 방법 등이 있을 것이다. 이런 방법은 어려운 시계열 데이터 분석을 배우지 않아도 실제 사업하는 분들이 현장에서 하고 있는 방법이다. 과연 데이터 분석가인 우리가 하는 정교한 시계열 데이터 예측 방법이 감으로 하는 상인들의 예측보다 더 정확할까? 정확하다면 얼마나 더 정확할까? 이번 시리즈에서는 시계열 예측을 수행하는 절차와 예측하는 데 사용하는 도구, 예측 결과를 확인하는 방법 등에 대해 다룬다. Tidy한 예측 절차 시계열 예측은 데이터를 tidy 한 포맷으로 정리하고, 결..
-
시계열 분석 시리즈 III (Time Series Features)카테고리 없음 2024. 3. 17. 22:13
시계열 데이터의 여러 특성 가시화 시계열 데이터 특성(Features) 시계열 데이터의 특성과 통계처리를 위한 전문 패키지인 feasts가 개발되어 쉽게 시계열 데이터를 분석할 수 있게 되었다. feasts 패키지는 FEatures And Statistics from Time Series 약어이다. 참조 : https://feasts.tidyverts.org/reference/index.html feasts 패키지는 시계열 데이터의 기본적인 통계량을 검출하고 시계열 데이터만의 고유한 특성 즉 자기상관, 성분 분해 등의 특징을 추출하고 가시화하는 강력한 패키지이다. 기본 통계량 일반 데이터프레임이나, tibble의 경우 summary 함수를 이용해서 통계량을 한눈에 보면 되지만, tsibble 객체의 경우..