-
RAG vs 온톨로지 시리즈 III (벡터 검색과 그래프를 결합한 GraphRAG)데이터 2026. 9. 26. 04:38
두 방식을 하나로이 글은 벡터 검색에 그래프의 관계를 더하는 GraphRAG를 직접 만들어 보고, 두 방식의 약점이 실제로 보완되는지 확인하기 위해 작성하였다.II편에서 두 방식의 약점이 뚜렷하게 드러났다. 벡터DB는 뜻이 비슷한 조문은 잘 찾지만, "누가 누구를 견제하는가"처럼 관계의 방향을 묻는 질문에서 0%를 받았다. 그래프DB는 관계를 정확히 따라가지만, 결과를 문장으로 설명하지 못하고 관계로 만들어 두지 않은 내용은 다루지 못하였다. 두 방식을 결합하면 서로의 약점을 메울 수 있을 것으로 기대하였다.이번 실험으로 알고자 한 것은 두 가지다.그래프를 더하면 벡터DB의 약점이 보완되는가결합한 뒤에도 남는 한계는 무엇인가시리즈의 마지막 글이다. I편에서는 두 데이터베이스를 구축하였고, II편에서는 같..
-
**「RAG vs 온톨로지 시리즈 II (질문 유형에 따른 비교)」**카테고리 없음 2026. 9. 25. 21:29
같은 질문, 세 가지 방식이 글은 I편에서 구축한 벡터DB와 그래프DB가 실제 질문에 어떻게 다르게 답하는지 확인하기 위해 작성하였다. 두 방식의 구조가 다르다는 것은 I편에서 확인하였다. 그러나 구조의 차이가 답변의 차이로 어떻게 나타나는지는 직접 질문해 보아야 알 수 있다.이번 실험으로 알고자 한 것은 두 가지다.질문의 성격에 따라 어느 방식이 더 나은 결과를 보이는가외부 지식 없이 생성 모델만으로 답하면 무엇이 부족한가시리즈 세 편 가운데 두 번째 글이다. I편에서는 두 데이터베이스를 구축하였고, 이번 II편에서는 같은 질문으로 비교한다. 마지막 III편에서는 둘을 결합한 GraphRAG를 다룬다.1. 실험 설계가. 세 가지 방식비교 대상은 세 가지다. 벡터DB와 그래프DB에 더하여, 외부 지식 없..
-
RAG vs 온톨로지 시리즈 I (헌법으로 벡터DB와 그래프DB 만들기)데이터 2026. 9. 25. 09:08
같은 문서, 두 가지 지식 저장 방식생성형 AI에 외부 지식을 제공하는 대표적인 방법은 두 가지다. 하나는 검색 증강 생성(RAG, Retrieval-Augmented Generation)이고 다른 하나는 온톨로지(Ontology)로 만든 지식 그래프다. RAG는 벡터 데이터베이스(Vector Database, 이하 벡터DB)를 쓰고, 지식 그래프는 그래프 데이터베이스(Graph Database, 이하 그래프DB)를 쓴다.두 방식을 설명하는 자료는 많다. 그러나 같은 데이터로 두 가지를 나란히 만들어 비교한 자료는 드물다. 설명만 읽어서는 두 방식의 차이가 잘 이해되지 않는다. 그래서 대한민국헌법 하나로 벡터DB와 그래프DB를 모두 구축해 보았다.이 실습으로 알고자 한 것은 세 가지다.두 방식은 문서를 ..
-
x-Learning데이터 2025. 1. 19. 23:02
머신러닝 공부하면서 맨 먼저 접하게 되는 단어가 지도학습(Supervised Learning), 비지도학습(Unsupervised Learning) 이란 단어일 것이다. 불과 얼마 전까지만 해도 지도학습, 비지도학습, 강화학습 등 학습방법의 종류가 그렇게 많지 않았다. 하지만 생성형 AI들이 큰 흐름을 형성하고 있는 최근 책이나 논문을 읽다 보면 접해보지 못했던 새로운 AI 학습 방법에 대한 용어들이 많이 등장한다. 이번 글은 각종 머신러닝 학습 방법과 개념을 포괄적으로 정리하여 필요할 때 참조할 수 있도록 정리하는 글을 작성한다. 여러가지를 한번에 통칭해서 표현할 때, x 라는 말을 사용하기에 여기서는 x-Learning 이란 제목으로 AI의 학습 방법과 종류들을 개관해 보기로 한다. 각각의 학습 방법..
-
생성형 AI 관련 몇가지 개념들 정리데이터 2024. 12. 22. 20:05
생성형 AI의 등장바야흐로 생성형 AI의 전성시대이다. 서비스하고 있는 AI의 종류도 많고 특성도 다르다. “어떤 업무에는 어떤 AI가 더 우수하더라”라는 평가도 다양하다. 정도 차이는 있겠지만 이제 chatGPT 같은 AI를 사용하지 않는 사람은 아마 없을 것이다. 최근 AI에 대한 많은 강연과 책을 읽고 있으나, 정확하게 내가 가려운 부분을 시원하게 긁어 주는 내용은 많지 않았다. 그 이유는 강연의 청중이나 책의 독자를 특정하지 않고 막연하게 일반 대중을 상대로 하다 보니 어떤 책은 이미 아는 내용이라 식상하고, 어떤 강연은 지나치게 구체적이고 상세해서 지루하게 느낀 것 같다. 이글은 AI나 머신러닝에 대한 리터러시를 어느 정도 갖춘 사람을 대상으로 생성형 AI의 발전 방향과 새로운 움직임에 대해 몇..
-
생성형 AI와 협업하기데이터 2024. 11. 10. 22:57
LLM 전성시대그야말로 AI 전성시대다, 하루가 다르게 AI의 새로운 모델들이 발표되고, 갈수록 기능이 특화되고 또 다양화되고 있다. 이제 너 나 할 것 없이 한두개 AI는 친숙하게 사용할 수 있고, 업무에도 적극 활용하고 있다. 나만 하더라도 아침에 컴퓨터를 켜고 맨 처음 실행시키는게 GPT 이고 GPT와 인사하며 하루를 시작한다. “AI가 없었던 시절에 어떻게 일을 해었나?”하고 내 생활속에 깊이 들어와 있는 AI에 감사함을 느낀다. 그러면서도 막상 구체적인 업무에서 하고 있는 일을 GPT에게 시키려면 막연하고 어려움을 느끼게된다. 이 글에서는 GPT와 같이 코딩하고 데이터를 분석하면서 느꼈던 경험을 나누고자 한다. 워낙 다양한 상황이 가능하기 때문에 최근에 내가 경험한 일을 중심으로 구제적인 어떤 ..
-
기상분석 II(가시거리 분석)데이터 2024. 10. 27. 22:06
시정(Visibility)과 가시거리까만 물체가 하늘을 배경으로 멀리 지평선 상에 놓여 있다고 하자. 날이 어두워져서 주변 배경이 까맣게 된다면 우리도 더 이상 그 물체를 볼 수 없게 된다. 날이 어두워지는 것 처럼 공기 중에 오염 물질이 많이 섞여 있으면, 하늘색이 불투명하게 되어 가까운 물체도 볼 수 없게 될 것이다. 시정은 관측위치에서 볼 수 있는 거리의 정도를 측정하여 공기가 좋고 나쁜지를 쉽게 판단할 수 있는 척도이다. 시정은 공기 중에 존재하는 대기 오염물질의 종류와 양에 따라 변화가 생긴다. 흐린 날 멀리 있는 물체가 잘 보이지 않는 이유는 대기 오염물질들이 대상 물체에서 반사된 빛을 산란시키거나 흡수하여 눈에까지 도달하지 않기 때문이다. 황사가 심해지는 계절에는 시정이 공기가 얼마나 깨끗한..
-
기상분석 I (바람 분석)데이터 2024. 10. 13. 22:23
바람과 생활바람은 우리 생활에 다양한 영향을 미친다. 풍력 발전 같은 산업분야 뿐만 아니라, 항공기나 선박, 낚시 나 캠핑 같은 취미에 이르기까지 바람이 우리 생활에 미치는 영향은 크다. 이글은 누구나 생활하면서 느끼는 바람에 대한 느낌을 몇 가지 특성으로 가시화 시켜 본 글이다.데이터 수집 및 처리데이터는 기상청이 기상자료 개방 포털(https://data.kma.go.kr/cmmn/main.do)을 통해 제공하는 바람 데이터를 크롤링하였다. 2019년부터 2023년까지 5년 동안 매시간 수집된 바람 측정 데이터 20여만 건을 대상으로 하였다. 참고로 대상 지역은 내가 수행했던 프로젝트에서 지정되었던 지역(파주, 동두천, 철원, 인제, 속초)을 대상으로 하였고, 변수 타입 조정 등 필요한 전처리를 수행..