java简单网页抓取的实现方法

网友投稿 238 2023-08-05


java简单网页抓取的实现方法

本文实例讲述了java简单网页抓取的实现方法。分享给大家供大家参考。具体分析如下:

背景介绍

一 tcp简介

1 tcp 实现网络中点对点的传输

2 传输是通过ports和sockets

ports提供了不同类型的传输(例如 http的port是80)

1)sockets可以绑定在特定端口上,并且提供传输功能

2)一个port可以连接多个socket

二 URL简介

URL 是对可以从互联网上得到的资源的位置和访问方法的一种简洁的表示,是互联网上标准资源的地址。

互联网上的每个文件都有一个唯一的URL,它包含的信息指出文件的位置以及浏览器应该怎么处理它。

综上,我们要抓取网页的内容实质上就是通过url来抓取网页内容。

Java提供了两种方法:

一种是直接从URL读取网页

一种是通过 URLConnection来读取网页

其中的URLConnection是以http为核心的类,提供了很多关于连接http的函数

本文将给出基于URLConnection的实例代码。

在此之前我们先来看下关于url的异常。不了解java异常机制的请参看上一篇博文。

构造URL的异常MalformedURLException产生条件:url的字符串为空或者是不能辨认的协议

建立 URLConnection的异常 IOException产生条件: openConnection失败,注意openConnection时 代码还未连接远程,只是为连接远程做准备

综上所述,最终代码如下:

复制代码 代码如下:

import java.io.BufferedReader;

import java.io.IOException;

import java.io.InputStreamReader;

import java.net.HttpURLConnection;

import java.net.MalformedURLException;

import java.net.URL;

import java.net.URLConnection;

public class SimpleNetSpider {

    public static void main(String[] args) {

        try{

            URL u = new URL("http://docs.oracle.com/javase/tutorial/networking/urls/");

            URLConnection connection = u.openConnection();

            HttpURLConnection htCon = (HttpURLConnection) connection;

            int code = htCon.getResponseCode();

            if (code == HttpURLConnection.HTTP_OK)

            {

                System.out.println("find the website");

                BufferedReader in=new BufferedReader(new InputStreamReader(htCon.getInputStream()));

        VmYTbksbSZ        String inputLine;

                while ((inputLine = in.readLine()) != null)

                        System.out.println(inputLine);

                    in.close();

            }

            else

            {

                System.out.println("Can not access the website");

            }

        }

        catch(MalformedURLException e )

        { 

            System.out.println("Wrong URL");

        }

        catch(IOException e)

        {

            System.out.println("Can not connect");

        }

    }

}

希望本文所述对大家的Java程序设计有所帮助。


版权声明:本文内容由网络用户投稿,版权归原作者所有,本站不拥有其著作权,亦不承担相应法律责任。如果您发现本站中有涉嫌抄袭或描述失实的内容,请联系我们jiasou666@gmail.com 处理,核实后本网站将在24小时内删除侵权内容。

上一篇:IE8中动态创建script标签onload无效的解决方法
下一篇:Java判断时间段内文件是否更新的方法
相关文章

 发表评论

暂时没有评论,来抢沙发吧~