零基础写Java知乎爬虫之先拿百度首页练练手 -java教程-PHP中文网

首页

Java

java教程

零基础写Java知乎爬虫之先拿百度首页练练手

黄舟

Dec 24, 2016 am 11:11 AM

上一集中我们说到需要用Java来制作一个知乎爬虫，那么这一次，我们就来研究一下如何使用代码获取到网页的内容。

首先，没有HTML和CSS和JS和AJAX经验的建议先去W3C（点我点我）小小的了解一下。

说到HTML，这里就涉及到一个GET访问和POST访问的问题。

如果对这个方面缺乏了解可以阅读W3C的这篇：《GET对比POST》。

啊哈，在此不再赘述。

然后咧，接下来我们需要用Java来爬取一个网页的内容。

这时候，我们的百度就要派上用场了。

没错，他不再是那个默默无闻的网速测试器了，他即将成为我们的爬虫小白鼠！~

我们先来看看百度的首页：

相信大家都知道，现在这样的一个页面，是HTML和CSS共同工作的结果。

我们在浏览器中右击页面，选择“查看页面源代码”：

没错，就是这一坨翔一样的东西。这就是百度页面的源代码。

接下来我们的任务，就是使用我们的爬虫也获取到一样的东西。

先来看一段简单的源码：

import java.io.*;
import java.net.*;
public class Main {
 public static void main(String[] args) {
  // 定义即将访问的链接
  String url = "http://www.baidu.com";
  // 定义一个字符串用来存储网页内容
  String result = "";
  // 定义一个缓冲字符输入流
  BufferedReader in = null;
  try {
   // 将string转成url对象
   URL realUrl = new URL(url);
   // 初始化一个链接到那个url的连接
   URLConnection connection = realUrl.openConnection();
   // 开始实际的连接
   connection.connect();
   // 初始化 BufferedReader输入流来读取URL的响应
   in = new BufferedReader(new InputStreamReader(
     connection.getInputStream()));
   // 用来临时存储抓取到的每一行的数据
   String line;
   while ((line = in.readLine()) != null) {
    //遍历抓取到的每一行并将其存储到result里面
    result += line;
   }
  } catch (Exception e) {
   System.out.println("发送GET请求出现异常！" + e);
   e.printStackTrace();
  }
  // 使用finally来关闭输入流
  finally {
   try {
    if (in != null) {
     in.close();
    }
   } catch (Exception e2) {
    e2.printStackTrace();
   }
  }
  System.out.println(result);
 }
}

以上就是Java模拟Get访问百度的Main方法，

可以运行一下看看结果：

啊哈，和我们前面用浏览器看到的一模一样。至此，一个最最简单的爬虫就算是做好了。

但是这么一大坨东西未必都是我想要的啊，怎么从中抓取出我想要的东西呢？

以百度的大爪子Logo为例。

临时需求：

获取百度Logo的大爪子的图片链接。

先说一下浏览器的查看方法。

鼠标对图片右击，选择审查元素（火狐，谷歌，IE11，均有此功能，只是名字不太一样）：

啊哈，可以看到在一大堆div的围攻下的可怜的img标签。

这个src就是图像的链接了。

那么在java中我们怎么搞呢？

事先说明，为了方便演示代码，所有代码均未作类封装，还请谅解。

我们先把前面的代码封装成一个sendGet函数：

import java.io.*;
import java.net.*;
public class Main {
 static String sendGet(String url) {
  // 定义一个字符串用来存储网页内容
  String result = "";
  // 定义一个缓冲字符输入流
  BufferedReader in = null;
  try {
   // 将string转成url对象
   URL realUrl = new URL(url);
   // 初始化一个链接到那个url的连接
   URLConnection connection = realUrl.openConnection();
   // 开始实际的连接
   connection.connect();
   // 初始化 BufferedReader输入流来读取URL的响应
   in = new BufferedReader(new InputStreamReader(
     connection.getInputStream()));
   // 用来临时存储抓取到的每一行的数据
   String line;
   while ((line = in.readLine()) != null) {
    // 遍历抓取到的每一行并将其存储到result里面
    result += line;
   }
  } catch (Exception e) {
   System.out.println("发送GET请求出现异常！" + e);
   e.printStackTrace();
  }
  // 使用finally来关闭输入流
  finally {
   try {
    if (in != null) {
     in.close();
    }
   } catch (Exception e2) {
    e2.printStackTrace();
   }
  }
  return result;
 }
 public static void main(String[] args) {
  // 定义即将访问的链接
  String url = "http://www.baidu.com";
  // 访问链接并获取页面内容
  String result = sendGet(url);
  System.out.println(result);
 }
}

这样看起来稍微整洁了一点，请原谅我这个强迫症。

接下来的任务，就是从获取到的一大堆东西里面找到那个图片的链接。

我们首先可以想到的方法，是对页面源码的字符串result使用indexof函数进行String的子串搜索。

没错这个方法是可以慢慢解决这个问题，比如直接indexOf("src")找到开始的序号，然后再稀里哗啦的搞到结束的序号。

不过我们不能一直使用这种方法，毕竟草鞋只适合出门走走，后期还是需要切假腿来拿人头的。

请原谅我的乱入，继续。

那么我们用什么方式来寻找这张图片的src呢？

没错，正如下面观众所说，正则匹配。

如果有同学不太清楚正则，可以参照这篇文章：[Python]网络爬虫（七）：Python中的正则表达式教程。

简单来说，正则就像是匹配。

比如三个胖子站在这里，分别穿着红衣服，蓝衣服，绿衣服。

正则就是：抓住那个穿绿衣服的！

然后把绿胖子单独抓了出来。

就是这么简单。

但是正则的语法却还是博大精深的，刚接触的时候难免有点摸不着头脑，

向大家推荐一个正则的在线测试工具：正则表达式在线测试。

有了正则这个神兵利器，那么怎么在java里面使用正则呢？

以上就是零基础写Java知乎爬虫之先拿百度首页练练手的内容，更多相关内容请关注PHP中文网（www.php.cn）！

声明

本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

如何将Maven或Gradle用于高级Java项目管理，构建自动化和依赖性解决方案？Mar 17, 2025 pm 05:46 PM

本文讨论了使用Maven和Gradle进行Java项目管理，构建自动化和依赖性解决方案，以比较其方法和优化策略。

如何使用适当的版本控制和依赖项管理创建和使用自定义Java库（JAR文件）？Mar 17, 2025 pm 05:45 PM

本文使用Maven和Gradle之类的工具讨论了具有适当的版本控制和依赖关系管理的自定义Java库（JAR文件）的创建和使用。

如何使用咖啡因或Guava Cache等库在Java应用程序中实现多层缓存？Mar 17, 2025 pm 05:44 PM

本文讨论了使用咖啡因和Guava缓存在Java中实施多层缓存以提高应用程序性能。它涵盖设置，集成和绩效优势，以及配置和驱逐政策管理最佳PRA

如何将JPA（Java持久性API）用于具有高级功能（例如缓存和懒惰加载）的对象相关映射？Mar 17, 2025 pm 05:43 PM

本文讨论了使用JPA进行对象相关映射，并具有高级功能，例如缓存和懒惰加载。它涵盖了设置，实体映射和优化性能的最佳实践，同时突出潜在的陷阱。[159个字符]

Java的类负载机制如何起作用，包括不同的类载荷及其委托模型？Mar 17, 2025 pm 05:35 PM

Java的类上载涉及使用带有引导，扩展程序和应用程序类负载器的分层系统加载，链接和初始化类。父代授权模型确保首先加载核心类别，从而影响自定义类LOA

如何将Java的RMI（远程方法调用）用于分布式计算？Mar 11, 2025 pm 05:53 PM

本文解释了用于构建分布式应用程序的Java的远程方法调用（RMI）。它详细介绍了接口定义，实现，注册表设置和客户端调用，以解决网络问题和安全性等挑战。

如何使用Java的插座API进行网络通信？Mar 11, 2025 pm 05:53 PM

本文详细介绍了用于网络通信的Java的套接字API，涵盖了客户服务器设置，数据处理和关键考虑因素，例如资源管理，错误处理和安全性。它还探索了性能优化技术，我

如何在Java中创建自定义网络协议？Mar 11, 2025 pm 05:52 PM

本文详细介绍了创建自定义Java网络协议。它涵盖协议定义（数据结构，框架，错误处理，版本控制），实现（使用插座），数据序列化和最佳实践（效率，安全性，维护

See all articles

热AI工具

热工具

mPDF是一个PHP库，可以从UTF-8编码的HTML生成PDF文件。原作者Ian Back编写mPDF以从他的网站上“即时”输出PDF文件，并处理不同的语言。与原始脚本如HTML2FPDF相比，它的速度较慢，并且在使用Unicode字体时生成的文件较大，但支持CSS样式等，并进行了大量增强。支持几乎所有语言，包括RTL（阿拉伯语和希伯来语）和CJK（中日韩）。支持嵌套的块级元素（如P、DIV），

禅工作室 13.0.1

功能强大的PHP集成开发环境

显示更多

零基础写Java知乎爬虫之先拿百度首页练练手

热AI工具

Undresser.AI Undress

AI Clothes Remover

Undress AI Tool

Clothoff.io

AI Hentai Generator

热门文章

热工具

Dreamweaver CS6

ZendStudio 13.5.1 Mac

VSCode Windows 64位下载

mPDF

禅工作室 13.0.1

热门话题

零基础写Java知乎爬虫之先拿百度首页练练手

热AI工具

Undresser.AI Undress

AI Clothes Remover

Undress AI Tool

Clothoff.io

AI Hentai Generator

热门文章

热工具

Dreamweaver CS6

ZendStudio 13.5.1 Mac

VSCode Windows 64位 下载

mPDF

禅工作室 13.0.1

热门话题

VSCode Windows 64位下载