HTML 텍스트 추출
HTML에서 태그를 걷어내고 사람이 읽는 텍스트만 뽑아냅니다. 링크·이미지 목록도 함께 추출합니다.
HTML
페이지 소스나 HTML 조각을 붙여넣으세요. 서버로 전송되지 않습니다.
추출한 글자수
0자
- 글자수
- 0자
- 링크
- 0개
- 이미지
- 0개
본문 텍스트
계산 방법
HTML에서 사람이 읽는 텍스트만 뽑아냅니다. 태그를 걷어내되, 문단·제목·목록 같은 블록 요소는 줄바꿈으로 바꿔 문서의 구조를 어느 정도 살립니다. script·style 안의 코드와 주석은 통째로 제거합니다.
&, < 같은 엔티티는 실제 문자(&, <)로 복원하고, 링크와 이미지 주소는 따로 목록으로 뽑아 줍니다. 웹 페이지 본문만 복사하거나, 문서에 걸린 링크를 한 번에 모을 때 유용합니다.
링크·이미지 주소는 HTML에 적힌 그대로 나옵니다. 상대경로("/about")는 상대경로로 나오므로, 완전한 주소가 필요하면 원본 문서의 도메인을 앞에 붙이세요. 모든 처리는 브라우저 안에서 이뤄집니다.
자주 묻는 질문
- Qscript나 style 안의 코드도 나오나요?
- A나오지 않습니다. script·style·noscript 태그는 내용까지 통째로 제거하고, 주석도 지웁니다. 화면에 보이는 텍스트만 남깁니다.
- Q& 같은 문자는 어떻게 되나요?
- A실제 문자로 복원됩니다. &는 &로, <는 <로, A는 A로 바뀝니다. 자주 쓰는 named 엔티티와 숫자·16진수 엔티티를 모두 처리합니다.
- Q링크가 상대경로로 나옵니다.
- AHTML에 적힌 그대로 뽑기 때문입니다. "/about"처럼 상대경로면 상대경로로, "https://..."면 전체 주소로 나옵니다. 원본 문서의 도메인을 알아야 완전한 주소가 됩니다.
- Q붙여넣은 HTML이 서버로 전송되나요?
- A전송되지 않습니다. 추출은 브라우저 안에서만 이뤄집니다.