ホームページ  >  に質問  >  本文

html - python中怎么获取某个网页元素之前的所有源码?

<html>
    <head>
        <title>The Dormouse's story </title>
    </head> 
    <body> 
        <p id="p1">p1p1p1
            <b id='b1'>b1b1b1</b>
        </p> 
        <p id="p2">p2p2p2
            <ul id='u1'>u1u1u1</ul>
            <a id="a1">a1a1a1</a>
            <p id='d1'>
                <a id="a2">a2a2a2 </a>
                <b id='b2'>b2b2b2</b>
                <p id='p3'>p3p3p3</p>
            </p>
            <a id="a3">a3a3a3 </a>
        </p> 
        <p id="p4">p4p4p4</p>
    </body>
</html>

比如第一个a元素:a#a1,要获取这个元素以上的所有网页源码:

<html>
    <head>
        <title>The Dormouse's story </title>
    </head> 
    <body> 
        <p id="p1">p1p1p1
            <b id='b1'>b1b1b1</b>
        </p> 
        <p id="p2">p2p2p2
            <ul id='u1'>u1u1u1</ul>
            <a id="a1">a1a1a1</a>
        </p>
    </body>
</html>
天蓬老师天蓬老师2741日前926

全員に返信(5)返信します

  • 阿神

    阿神2017-04-18 09:49:08

    元の HTML が標準に達していないため、少し変更しました。
    以下は lxml を使用して行われます。

    リーリー

    返事
    0
  • PHPz

    PHPz2017-04-18 09:49:08

    bs4 を使用して抽出します

    返事
    0
  • PHP中文网

    PHP中文网2017-04-18 09:49:08

    リーリー

    返事
    0
  • 阿神

    阿神2017-04-18 09:49:08

    初心者、私は re モジュールしか学ばなかったので、re モジュール + 通常の抽出方法のみを使用しました

    リーリー

    返事
    0
  • 伊谢尔伦

    伊谢尔伦2017-04-18 09:49:08

    be モジュールが最も便利です

    返事
    0
  • キャンセル返事