python实现爬虫下载漫画示例-Python教程-PHP中文网

首页

后端开发

Python教程

python实现爬虫下载漫画示例

WBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWB

Jun 06, 2016 am 11:29 AM

漫画爬虫

代码如下:

#!/usr/bin/python3.2
import os,socket
import urllib
import urllib.request,threading,time
import re,sys
global manhuaweb,weburl,floder,chapterbegin,currentthreadnum,threadcount,mutex,mutex2

weburl=''
floder=''
chapterbegin=0
currentthreadnum=0
threadcount=6

if len(sys.argv)>=3:
weburl=sys.argv[1]
floder=sys.argv[2]
else:
print("usag: downloadmanhua weburl floder chapterbegin=0 threadnnum=6")
sys.exit(0)
if len(sys.argv)>=4:
chapterbegin=int(sys.argv[3])
if len(sys.argv)>=5:
threadcount=(int)(sys.argv[4])

def jin(i,jinzhi):
        Finalans=""
        answer=i%jinzhi
        i=int(i/jinzhi)
        if answer>9:
            Finalans= ""
            Finalans=""
Finalans chr(ord('a') (answer-10))
         else:
               Finalans=finalans str(answer)
        如果我!=0 :
               Finalans=jin(i,jinzhi) Finalans
        return Finalans
def urlparse(p,a,c,k):
       d={}
        e=lambda c:     jin( c,36)
        如果 1:
                而 c:
                      c=c-1
                       如果不是 k[c]:
                            d[jin(c,36)]=jin(c ,36)                            d [jin(c,36)]=k[c]
               k=[lambda e:d[e]]
                 e=lambda c:'\w '
              c=1
        newstr= ""
        while c:
                 c=c-1
               if k[c]:
                        对于范围内的 i(0,len(p )):
                                                                            对于我
                           tempi=ord(tempi)
                              如果 tempi>=ord('a') 且 tempi                                                                                              来自 new (str) ( tempi)                            elif tempi>=ord('0') 和 tempi                                     newstr =d[chr(tempi)]
                              其他：
                                                                                                                                              一个
新闻的新闻() 🎜>        return newstr
def meipower(s):
         p=re.compile(r"(?=}\().*",re.IGNORECASE)
        s=p.findall(s)
        s=s[0]
        s=s[0:(len(s)-19)]
        par=s.split(',')
        par[3]=par[3][1:len(par[3])]
        answer=par[3].split('|')
        chapterpath=urlparse(par[0],int(par[1]),int(par[2]),answer)
        allurl=re.findall('imgpath=[^;]*',chapterpath)[0]
        allurl=allurl[10:(len(allurl)-2)]
        return allurl
def pictofile(weburl,filename,loop=100):
        if loop                print('can\'t download the picture %s'%weburl)
                return
        loop=loop-1
        if os.path.exists(filename):
            return
        try:
                url=urllib.request.urlopen(weburl)
                data=url.read()
                if len(data)                        url.close()
                        pictofile(weburl,filename,loop)
                else:
                        print('download from %s name is %s\n'%(weburl,filename))
                        myfile=open('%s'%filename,'wb')
                        myfile.write(data)
                        myfile.close()
                        url.close();
        except socket.timeout:
                print('timeout')
                pictofile(weburl,filename,loop)
        except Exception as e:
          print('error',e)
          pictofile(weburl,filename,loop)
        finally:
            pass
def downloadpic(url,loadpicdir,num):
    #download the all url picture to loadpicdir
    global currentthreadnum,mutex,mutex2
    mymode=re.compile(r'[0-9a-z.]*\Z')
    try:
                mutex2.acquire()
                os.chdir(loadpicdir)
                mutex2.release()
    except:
                print("can't open the floder %s will be create"%loadpicdir)
                try:
                    if(mutex2.locked()):
                        os.mkdir(loadpicdir)
                        os.chdir(loadpicdir)
                        mutex2.release()
                    print('create floder succeed')
                except:
                    print("can't create floder %s"%loadpicdir)
                    if(mutex.acquire()):
                        mutex.release()
                    quit(0)
    name=mymode.findall(url)
    filename='manhua'+name[0]
    pictofile(url,loadpicdir+'//'+str(num)+'-'+filename)
    mutex.acquire()
    currentthreadnum=currentthreadnum-1
    mutex.release()
def downloadchapter(url,loadpicdir,num,begin=0):
        global manhuaweb,threadcount,currentthreadnum,mutex
        print(manhuaweb+url)
        webdata=urllib.request.urlopen(manhuaweb+url).read()
        webdata=webdata.decode('UTF-8')
        chaptername=re.findall(r'

[^_]*',webdata)[0] chaptername=chaptername[7:len(chaptername)] webscrip=re.findall(r'eval.*[^]',webdata) chapterurl=meispower(webscrip[0]); chapterurl='http://mhimg.ali213.net'+chapterurl for i in range(begin,num): try: while(currentthreadnum>=threadcount): time.sleep(0.5) mutex.acquire() currentthreadnum=currentthreadnum+1 mutex.release() threading.Thread(target=downloadpic,args=(r'%s%d.jpg'%(chapterurl,i),loadpicdir+chaptername,num)).start() except socket.error: mutex.acquire() i=i-1 currentthreadnum=currentthreadnum-1 mutex.release() except Exception as error: print(error,'break') print('download chapter %d of picture make a error'%i) Break if __name__=='__main__': manhuaweb=r'http://manhua.ali213.net' socket.setdefaulttimeout(60.0) mutex=threading.Lock() mutex2=threading.Lock() webfile=urllib.request.urlopen(weburl) webdata=webfile.read(); webdata=webdata.decode('UTF-8') meshmode=re.compile (r' <div class="detail_body_right_sec_con">.*</div>') meshdata=meshmode.findall(webdata)[0] indexmode=re.compile(r'([0 -9]*页)') indexdata=indexmode.findall(meshdata) picurlmode=re.compile(r'/comic/[0-9/]*.html') picurldata=picurlmode.findall(meshdata) Chapterlength=len(picurldata) nummode=re.compile(r'[d] ') i=chapterbegin while i<chapterlength:> manhuachapter=picurldata[chapterlength-i-1] downloadchapter(manhuachapter,floder,int(nummode) .findall(indexdata[章节长度-i-1] )[0])) i=i 1 </chapterlength:>

声明

本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

python中两个列表的串联替代方案是什么？May 09, 2025 am 12:16 AM

可以使用多种方法在Python中连接两个列表：1.使用操作符，简单但在大列表中效率低；2.使用extend方法，效率高但会修改原列表；3.使用 =操作符，兼具效率和可读性；4.使用itertools.chain函数，内存效率高但需额外导入；5.使用列表解析，优雅但可能过于复杂。选择方法应根据代码上下文和需求。

Python：合并两个列表的有效方法May 09, 2025 am 12:15 AM

有多种方法可以合并Python列表：1.使用操作符，简单但对大列表不内存高效；2.使用extend方法，内存高效但会修改原列表；3.使用itertools.chain，适用于大数据集；4.使用*操作符，一行代码合并小到中型列表；5.使用numpy.concatenate，适用于大数据集和性能要求高的场景；6.使用append方法，适用于小列表但效率低。选择方法时需考虑列表大小和应用场景。

编译的与解释的语言：优点和缺点May 09, 2025 am 12:06 AM

CompiledLanguagesOffersPeedAndSecurity，而interneterpretledlanguages provideeaseafuseanDoctability.1）commiledlanguageslikec arefasterandSecureButhOnderDevevelmendeclementCyclesclesclesclesclesclesclesclesclesclesclesclesclesclesclesclesclesclesandentency.2）cransportedeplatectentysenty

Python：对于循环，最完整的指南May 09, 2025 am 12:05 AM

Python中，for循环用于遍历可迭代对象，while循环用于条件满足时重复执行操作。1）for循环示例：遍历列表并打印元素。2）while循环示例：猜数字游戏，直到猜对为止。掌握循环原理和优化技巧可提高代码效率和可靠性。

python concatenate列表到一个字符串中May 09, 2025 am 12:02 AM

要将列表连接成字符串，Python中使用join()方法是最佳选择。1)使用join()方法将列表元素连接成字符串，如''.join(my_list)。2)对于包含数字的列表，先用map(str,numbers)转换为字符串再连接。3)可以使用生成器表达式进行复杂格式化，如','.join(f'({fruit})'forfruitinfruits)。4)处理混合数据类型时，使用map(str,mixed_list)确保所有元素可转换为字符串。5)对于大型列表，使用''.join(large_li

Python的混合方法：编译和解释合并May 08, 2025 am 12:16 AM

pythonuseshybridapprace，ComminingCompilationTobyTecoDeAndInterpretation.1）codeiscompiledtoplatform-Indepententbybytecode.2）bytecodeisisterpretedbybythepbybythepythonvirtualmachine，增强效率和通用性。

了解python的' for”和' then”循环之间的差异May 08, 2025 am 12:11 AM

theKeyDifferencesBetnewpython's“ for”和“ for”和“ loopsare：1）” for“ loopsareIdealForiteringSequenceSquencesSorkNowniterations，而2）”，而“ loopsareBetterforConterContinuingUntilacTientInditionIntionismetismetistismetistwithOutpredefinedInedIterations.un