Maison > Questions et réponses > le corps du texte
Lorsque j'écris un robot, il sera toujours OOM après avoir fonctionné pendant un certain temps (pas plus de 12 heures). Très impuissant ! ! !
Selon la documentation officielle, j'ai utilisé ce prefs() mais je n'ai vraiment pas trouvé le problème.
Live References
HtmlResponse 42 oldest: 753s ago
MySuteSpider 1 oldest: 2964s ago
Request 32412 oldest: 2920s ago
Selector 42 oldest: 751s ago
TripItem 37 oldest: 751s ago
Le processus du robot consiste à obtenir les liens de la balise a de toutes les pages :
#获取域名的后缀
def get_domain_suffix(domain):
if 'com' in tldextract.extract(domain).suffix:
return True
return False
#拼接域名。只存主域名
def save_domain(domain):
domain_name = tldextract.extract(domain).domain
suffix_name = tldextract.extract(domain).suffix
return domain_name + '.' + suffix_name
#获取域名ip
def get_domain_ip(domain):
try:
ip = socket.gethostbyname(domain)
return ip
except:
return '114.114.114.114'
# 获取域名所在的国家
def get_domain_ct_iso(ip):
GEO = geoip2.database.Reader(
'/var/test/geodb/GeoLite2-City.mmdb')
r = GEO.city(ip)
return r.country.iso_code
class MyDomainSpider(scrapy.Spider):
name = 'my_domain'
start_urls = [
'http://xxx.com
]
def parse_items(self, response):
item = TripItem()
for url in response.xpath('//a/@href').extract():
if url.startswith('http'):
domain = urlparse.urlparse(url).netloc
if get_domain_tw(domain) or get_domain_ct_iso(get_domain_ip(domain)) == 'US':
item['domain'] = save_domain(domain)
item['ip'] = get_domain_ip(domain)
item['datetime'] = datetime.datetime.now().strftime("%Y-%m-%d %H:%M:%S")
yield item
def parse(self, response):
for url in response.xpath('//a/@href').extract():
if url.startswith('http'):
domain = urlparse.urlparse(url).netloc
if get_domain_tw(domain) or get_domain_ct_iso(get_domain_ip(domain)) == 'US':
yield scrapy.Request(url, callback=self.parse_items)
S'il vous plaît, donnez-moi quelques conseils, merci
巴扎黑2017-06-30 09:55:22
yield item
Faut-il l'implémenter et sauvegarder des fichiers ou une base de données, sinon il sera stocké en mémoire ?