>  기사  >  웹 프론트엔드  >  HTML을 워드 자바로

HTML을 워드 자바로

WBOY
WBOY원래의
2023-05-21 12:18:08796검색

인터넷 기술이 발전하면서 점점 더 많은 애플리케이션이 개발되었으며, 그중 HTML과 Word는 우리가 자주 사용하는 두 가지 애플리케이션입니다. HTML은 웹 페이지 및 기타 웹 문서를 만드는 데 사용되는 마크업 언어입니다. Word는 문서를 만들고 편집하는 데 사용되는 텍스트 편집 프로그램입니다. 웹 사이트 유지 관리 중에 오프라인으로 보기 위해 HTML 문서에서 Word 문서를 만들어야 하거나 온라인 보고서를 업로드할 수 있는 문서로 변환해야 하는 경우와 같이 HTML을 Word로 변환해야 하는 상황이 많이 있습니다. 이번 글에서는 Java 코드를 사용하여 HTML을 Word 문서로 변환하는 방법을 소개하겠습니다.

  1. 필수 라이브러리 가져오기
    먼저 필수 라이브러리를 가져와야 합니다. 우리는 Java 코드를 사용할 것이므로 내장된 Java 라이브러리가 필요하고 Apache POI 라이브러리를 사용하여 Word 문서를 처리합니다. 이 라이브러리를 사용하려면 프로젝트에 다음 종속성을 추가해야 합니다.

5d2ae825d96e6b79836fc3ca23d94234

<dependency>
    <groupId>org.apache.poi</groupId>
    <artifactId>poi</artifactId>
    <version>3.17</version>
</dependency>
<dependency>
    <groupId>org.apache.poi</groupId>
    <artifactId>poi-ooxml</artifactId>
    <version>3.17</version>
</dependency>
<dependency>
    <groupId>org.jsoup</groupId>
    <artifactId>jsoup</artifactId>
    <version>1.10.1</version>
</dependency>

c2b53eff10040a78d53eb382cbd5b345

  1. HTML 파일 준비
    HTML 파일을 변환하기 전에 먼저 HTML 파일을 준비해야 합니다. 이는 웹사이트에서 다운로드한 문서일 수도 있고 직접 만든 파일일 수도 있습니다. 튜토리얼을 단순화하기 위해 나중에 예제로 사용할 HTML 파일을 생성하겠습니다. 파일은 메모장이나 기타 텍스트 편집기를 통해 만들 수 있습니다.

8b05045a5be5764f313ed5b9168a17e6
100db36a723c770d327fc0aef2ce13b1
93f0f5c25f18dab9d176bd4f6de5d30e

<meta charset="UTF-8">
<title>HTML to Word Conversion</title>

9c3bca370b5104690d9ef395f2c5f8d1
6c04bd5ca3fcae76e30b72ad730ca86d

<h1>This is a sample HTML file</h1>
<p>Here is some text that we will convert to Word format.</p>
<ul>
    <li>List item 1</li>
    <li>List item 2</li>
    <li>List item 3</li>
</ul>
<br />
<ol>
    <li>Numered item 1</li>
    <li>Numered item 2</li>
    <li>Numered item 3</li>
</ol>

36cc49f0c466276486e50c850b7e4956
73a6ac4ed44ffec12cee46588e518a5e

  1. 읽기 HTML 파일을 가져와 Word 문서로 변환
    이 단계에서는 HTML 파일을 읽어 Word 문서로 변환해 보겠습니다. 이렇게 하려면 이 작업을 수행하기 위해 ConvertHtmlToWord라는 메서드를 정의해야 합니다. 이 방법은 JSoup 라이브러리를 사용하여 HTML 파일의 내용을 읽고 Apache POI 라이브러리를 사용하여 이를 Word 문서 형식으로 변환합니다. Java 클래스에 다음 코드를 작성해 주세요.

import java.io.*;
import org.apache.poi.xwpf.usermodel.*;
import org.jsoup.*;
import org.jsoup.nodes.*;
import org.jsoup.select. *;

public class HtmlToWordConverter {

public static void main(String[] args) {
    String inputFilePath = "D:\sample.html";
    String outputFilePath = "D:\sample.docx";
    convertHtmlToWord(inputFilePath, outputFilePath);
}

public static void convertHtmlToWord(String inputFilePath, String outputFilePath) {
    try {
        String html = readFile(inputFilePath);
        Document document = Jsoup.parse(html);
        XWPFDocument doc = new XWPFDocument();

        Elements elements = document.body().children();
        for (Element element : elements) {
            if (element.tagName().equals("h1")) {
                XWPFParagraph paragraph = doc.createParagraph();
                XWPFRun run = paragraph.createRun();
                run.setText(element.text());
                run.setBold(true);
            } else if (element.tagName().equals("p")) {
                XWPFParagraph paragraph = doc.createParagraph();
                XWPFRun run = paragraph.createRun();
                run.setText(element.text());
            } else if (element.tagName().equals("ul")) {
                XWPFParagraph paragraph = doc.createParagraph();
                XWPFRun run = paragraph.createRun();

                Elements listItems = element.children();
                int i = 1;
                for (Element listItem : listItems) {
                    run.setText(i + ". " + listItem.text() + "

");

                    i++;
                }
            } else if (element.tagName().equals("ol")) {
                XWPFParagraph paragraph = doc.createParagraph();
                XWPFRun run = paragraph.createRun();

                Elements listItems = element.children();
                int i = 1;
                for (Element listItem : listItems) {
                    run.setText(listItem.text() + "

");

                    i++;
                }
            }
        }

        FileOutputStream out = new FileOutputStream(outputFilePath);
        doc.write(out);
        out.close();
    } catch (IOException ex) {
        System.out.println(ex.getMessage());
    }
}

public static String readFile(String filePath) {
    try {
        BufferedReader reader = new BufferedReader(new FileReader(filePath));
        StringBuilder stringBuilder = new StringBuilder();
        String line;
        while ((line = reader.readLine()) != null) {
            stringBuilder.append(line);
        }
        return stringBuilder.toString();
    } catch (IOException ex) {
        System.out.println(ex.getMessage());
        return null;
    }
}

}

  1. Java 코드를 실행하고 출력을 확인하세요
    이제 Java 코드를 실행하고 출력을 확인할 수 있습니다. 이 코드를 실행하려면 명령줄에 다음 명령을 입력해야 합니다.

java -cp ".;path-to-all-dependent-jars*" HtmlToWordConverter

path-to-all-dependent-jars를 다운로드한 모든 Jar의 경로로 바꿔야 합니다. Windows 운영 체제에서는 세미콜론을 사용하여 Jars 경로를 구분합니다.

코드를 실행하면 지정된 출력 경로에 Sample.docx라는 Word 문서가 생성됩니다. Word 문서를 열고 내용을 확인하세요. HTML 파일의 내용과 유사한 내용이 표시됩니다. HTML 파일에 이미지를 추가하면 Word 문서에도 그에 따라 표시됩니다.

결론:
이 게시물에서는 Java 코드를 사용하여 HTML 파일을 Word 문서로 변환하는 방법을 소개했습니다. 우리는 Apache POI 및 JSoup 라이브러리를 사용하여 HTML 파일을 읽고 이를 Word 문서 형식으로 변환했습니다. 간단한 HTML 파일에서 이 방법은 매우 효율적이며 직접 사용할 수 있습니다. 그러나 더 복잡한 HTML 파일의 경우 변환하려는 대상 형식에 따라 더 세부적인 조정이 필요할 수 있습니다.

위 내용은 HTML을 워드 자바로의 상세 내용입니다. 자세한 내용은 PHP 중국어 웹사이트의 기타 관련 기사를 참조하세요!

성명:
본 글의 내용은 네티즌들의 자발적인 기여로 작성되었으며, 저작권은 원저작자에게 있습니다. 본 사이트는 이에 상응하는 법적 책임을 지지 않습니다. 표절이나 침해가 의심되는 콘텐츠를 발견한 경우 admin@php.cn으로 문의하세요.
이전 기사:HTML 숨겨진 태그다음 기사:HTML 숨겨진 태그