웹 크롤링을 이용한 유해사이트 수집 방법

Methods for Collecting Harmful Websites Using Web Crawling

초록

최근 정부의 유해사이트 차단 노력에도 불구하고 이를 우회하는 방법이 계속 생겨나고 있어 유해사이트는 여전히 줄어들지 않고 있다. 지속적이고 적극적인 유해사이트의 차단을 위해서는 유해사이트의 정보를 다양하게 수집하고 관리하는 시스템이 필요하다. 본 논문에서는 유해사이트의 링크를 모아놓은 웹사이트를 이용하여 효과적으로 유해사이트 정보를 수집하는 웹 크롤러를 제안한다. 제안한 웹 크롤러는 유해사이트의 다양한 정보를 수집한다. 특히 유해사이트 홍보 수단인 SNS(Social Networking Service)를 추적하여 변경될 URL 정보를 수집하고, Cloudflare와 같은 CDN(Content Delivery Network) 서비스 사용 여부를 확인하여 유해사이트의 운영 형태를 파악할 수 있다. 제안한 웹 크롤러를 이용해 수집한 결과 약 95%의 유해사이트 판별율(456개 중 433개)을 보였다. 따라서 제안한 웹 크롤러가 앞으로의 유해사이트 차단을 위한 정책 수립에 도움을 줄 수 있을 것으로 기대한다.

키워드

저작권 디지털 포렌식웹 크롤링유해사이트Copyright Digital ForensicsWeb CrawlingHarmful Websites
제목
웹 크롤링을 이용한 유해사이트 수집 방법
제목 (타언어)
Methods for Collecting Harmful Websites Using Web Crawling
저자
추승용황예성이상진
DOI
10.22798/kdfs.2021.15.3.127
발행일
2021
저널명
디지털포렌식연구
15
3
페이지
127 ~ 138