HttpClient详细使用

HttpClient及有关jar包详解 
1.HttpClient简介 
  HttpClient 是 Apache Jakarta Common 下的子项目,能够用来供给高效的、最新的、功用丰厚的撑持 HTTP 协议的客户端编程东西包,而且它撑持 HTTP 协议最新的版别和主张。本文首要剖析 HTTPClient,然后依据作者实践工作经验给出了一些常见难题的解决办法。HTTP 协议能够是如今 Internet 上运用得最多、最重要的协议了,越来越多的 Java 应用程序需要直接经过 HTTP 协议来拜访网络资源。虽然在 JDK 的 java.net 包中现已供给了拜访 HTTP 协议的基本功用,可是关于大多数应用程序来说,JDK 库自身供给的功用还不行丰厚和灵敏。HttpClient 是 Apache Jakarta Common 下的子项目,用来供给高效的、最新的、功用丰厚的撑持 HTTP 协议的客户端编程东西包,而且它撑持 HTTP 协议最新的版别和主张。HttpClient 现已应用在许多的项目中,比方 Apache Jakarta 上很闻名的别的两个开源项目 Cactus 和 HTMLUnit 都运用了 HttpClient。如今HttpClient最新版别为 HttpClient 4.0-beta2 
2.HttpClient 功用剖析 
  以下列出的是 HttpClient 供给的首要的功用,要知道更多详细的功用能够拜见 HttpClient 的主页。 

  (1)完结了一切 HTTP 的办法(GET,POST,PUT,HEAD 等) 

  (2)撑持主动转向 

  (3)撑持 HTTPS 协议 

  (4)撑持署理效劳器等 
3.HttpClient 基本功用的运用 
  (1) GET办法 

  运用 HttpClient 需要以下 6 个进程: 

  1. 创立 HttpClient 的实例 

  2. 创立某种衔接办法的实例,在这里是 GetMethod。在 GetMethod 的结构函数中传入待衔接的地址 

  3. 调用第一步中创立好的实例的 execute 办法来履行第二步中创立好的 method 实例 

  4. 读 response 

  5. 开释衔接。无论履行办法能否成功,都有必要开释衔接 

  6. 对得到后的内容进行处置 

  依据以上进程,咱们来编写用GET办法来取得某网页内容的代码。 

  大多数状况下 HttpClient 默许的结构函数现已满足运用。 HttpClient httpClient = new HttpClient(); 

  创立GET办法的实例。在GET办法的结构函数中传入待衔接的地址即可。用GetMethod将会主动处置转发进程,若是想要把主动处置转发进程去掉的话,能够调用办法setFollowRedirects(false)。 GetMethod getMethod = new GetMethod("....."); 

  调用实例httpClient的executeMethod办法来履行getMethod。由所以履行在网络上的程序,在运转executeMethod办法的时分,需要处置两个反常,分别是HttpException和IOException。导致第一种反常的缘由首要能够是在结构getMethod的时分传入的协议不对,比方不小心将"http"写成"htp",或许效劳器端回来的内容不正常等,而且该反常发作是不行康复的;第二种反常通常是由于网络缘由导致的反常,关于这种反常 (IOException),HttpClient会依据你指定的康复战略主动试着从头履行executeMethod办法。HttpClient的康复战略能够自界说(经过完结接口HttpMethodRetryHandler来完结)。经过httpClient的办法setParameter设置你完结的康复战略,本文中运用的是体系供给的默许康复战略,该战略在碰到第二类反常的时分将主动重试3次。executeMethod回来值是一个整数,标明了履行该办法后效劳器回来的状况码,该状况码能标明出该办法履行能否成功、需要认证或许页面发作了跳转(默许状况下GetMethod的实例是主动处置跳转的)等。 //设置成了默许的康复战略,在发作反常时分将主动重试3次,在这里你也能够设置成自界说的康复战略 

  getMethod.getParams().setParameter(HttpMethodParams.RETRY_HANDLER, 

  new DefaultHttpMethodRetryHandler()); 

  //履行getMethod 

  int statusCode = client.executeMethod(getMethod); 

  if (statusCode != HttpStatus.SC_OK) { 

  System.err.println("Method failed: " + getMethod.getStatusLine()); 

  } 

  在回来的状况码正确后,即可取得内容。取得方针地址的内容有三种办法:第一种,getResponseBody,该办法回来的是方针的二进制的byte流;第二种,getResponseBodyAsString,这个办法回来的是String类型,值得注重的是该办法回来的String的编码是依据体系默许的编码办法,所以回来的String值能够编码类型有误,在本文的"字符编码"有些中将对此做详细剖析;第三种,getResponseBodyAsStream,这个办法关于方针地址中有很多数据需要传输是最佳的。在这里咱们运用了最简略的getResponseBody办法。 byte[] responseBody = method.getResponseBody(); 

  开释衔接。无论履行办法能否成功,都有必要开释衔接。 method.releaseConnection(); 

  处置内容。在这一步中依据你的需要处置内容,在比方中仅仅简略的将内容打印到控制台。 System.out.println(new String(responseBody)); 

  下面是程序的完好代码,这些代码也可在附件中的test.GetSample中找到。 

  package test; 

  import java.io.IOException; 

  import org.apache.commons.httpclient.*; 

  import org.apache.commons.httpclient.methods.GetMethod; 

  import org.apache.commons.httpclient.params.HttpMethodParams; 

  public class GetSample{ 

  public static void main(String[] args) { 

  //结构HttpClient的实例 

  HttpClient httpClient = new HttpClient(); 

  //创立GET办法的实例 

  GetMethod getMethod = new GetMethod("..."); 

  //运用体系供给的默许的康复战略 

  getMethod.getParams().setParameter(HttpMethodParams.RETRY_HANDLER, 

  new DefaultHttpMethodRetryHandler()); 

  try { 

  //履行getMethod 

  int statusCode = httpClient.executeMethod(getMethod); 

  if (statusCode != HttpStatus.SC_OK) { 

  System.err.println("Method failed: " 

  + getMethod.getStatusLine()); 

  } 

  //读取内容 

  byte[] responseBody = getMethod.getResponseBody(); 

  //处置内容 

  System.out.println(new String(responseBody)); 

  } catch (HttpException e) { 

  //发作丧命的反常,能够是协议不对或许回来的内容有难题 

  System.out.println("Please check your provided http address!"); 

  e.printStackTrace(); 

  } catch (IOException e) { 

  //发作网络反常 

  e.printStackTrace(); 

  } finally { 

  //开释衔接 

  getMethod.releaseConnection(); 

  } 

  } 

  } 

  (2)POST办法 

  依据RFC2616,对POST的解说如下:POST办法用来向意图效劳器宣布恳求,需要它承受被附在恳求后的实体,并把它当作恳求行列(Request-Line)中恳求URI所指定资源的附加新子项。POST被描绘成用一致的办法完结下列功用: 

  对现有资源的注释(Annotation of existing resources) 

  向电子公告栏、新闻组,邮件列表或相似讨论组发送音讯 

  提交数据块,如将表单的成果提交给数据处置进程 

  经过附加操作来扩大数据库 

  调用HttpClient中的PostMethod与GetMethod相似,除了设置PostMethod的实例与GetMethod有些不相同之外,剩余的进程都差不多。鄙人面的比方中,省去了与GetMethod相同的进程,只阐明与上面不相同的当地,并以登录清华大学BBS为比方进行阐明。 

  结构PostMethod之前的进程都相同,与GetMethod相同,结构PostMethod也需要一个URI参数。在创立了PostMethod的实例之后,需要给method实例填充表单的值,在BBS的登录表单中需要有两个域,第一个是用户名(域名叫id),第二个是暗码(域名叫passwd)。表单中的域用类NameValuePair来标明,该类的结构函数第一个参数是域名,第二参数是该域的值;将表单一切的值设置到PostMethod顶用办法setRequestBody。别的由于BBS登录成功后会转向别的一个页面,可是HttpClient关于需要承受后继效劳的恳求,比方POST和PUT,不撑持主动转发,因而需要个人对页面转向做处置。详细的页面转向处置请拜见下面的"主动转向"有些。代码如下: 

  String url = "...."; 

  PostMethod postMethod = new PostMethod(url); 

  // 填入各个表单域的值 

  NameValuePair[] data = { new NameValuePair("id", "youUserName"), 

  new NameValuePair("passwd", "yourPwd") }; 

  // 将表单的值放入postMethod中 

  postMethod.setRequestBody(data); 

  // 履行postMethod 

  int statusCode = httpClient.executeMethod(postMethod); 

  // HttpClient关于需要承受后继效劳的恳求,象POST和PUT等不能主动处置转发 

  // 301或许302 

  if (statusCode == HttpStatus.SC_MOVED_PERMANENTLY || 

  statusCode == HttpStatus.SC_MOVED_TEMPORARILY) { 

  // 从头中取出转向的地址 

  Header locationHeader = postMethod.getResponseHeader("location"); 

  String location = null; 

  if (locationHeader != null) { 

  location = locationHeader.getValue(); 

  System.out.println("The page was redirected to:" + location); 

  } else { 

  System.err.println("Location field value is null."); 

  } 

  return; 

  } 
[修改本段] 
4 运用HttpClient进程中常见的一些难题 
  下面剖析在运用HttpClient进程中常见的一些难题。 

  字符编码 

  某方针页的编码能够出如今两个当地,第一个当地是效劳器回来的http头中,别的一个当地是得到的html/xml页面中。 

  在http头的Content-Type字段能够会包括字符编码信息。例如能够回来的头会包括这姿态的信息:Content-Type: text/html; charset=UTF-8。这个头信息标明该页的编码是UTF-8,可是效劳器回来的头信息未必与内容能匹配上。比方关于一些双字节言语国家,能够效劳器回来的编码类型是UTF-8,但真实的内容却不是UTF-8编码的,因而需要在别的的当地去得到页面的编码信息;可是若是效劳器回来的编码不是UTF-8,而是详细的一些编码,比方gb2312等,那效劳器回来的能够是正确的编码信息。经过method方针的getResponseCharSet()办法就能够得到http头中的编码信息。 

  关于象xml或许html这样的文件,答应作者在页面中直接指定编码类型。比方在html中会有这样的标签;或许在xml中会有这样的标签,在这些状况下,能够与http头中回来的编码信息抵触,需要用户个人判别究竟那种编码类型应该是真实的编码。 

  主动转向 

  依据RFC2616中对主动转向的界说,首要有两种:301和302。301标明永世的移走(Moved Permanently),当回来的是301,则标明恳求的资源现已被移到一个固定的新当地,任何向该地址建议恳求都会被转到新的地址上。302标明暂时的转向,比方在效劳器端的servlet程序调用了sendRedirect办法,则在客户端就会得到一个302的代码,这时效劳器回来的头信息中location的值就是sendRedirect转向的方针地址。 

  HttpClient撑持主动转向处置,可是象POST和PUT办法这种需要承受后继效劳的恳求办法,暂时不撑持主动转向,因而若是碰到POST办法提交后回来的是301或许302的话需要个人处置。就像方才在POSTMethod中举的比方:若是想进入登录BBS后的页面,有必要从头建议登录的恳求,恳求的地址能够在头字段location中得到。不过需要注重的是,有时分location回来的能够是相对途径,因而需要对location回来的值做一些处置才能够建议向新地址的恳求。 

  别的除了在头中包括的信息能够使页面发作重定向外,在页面中也有能够会发作页面的重定向。导致页面主动转发的标签是:。若是你想在程序中也处置这种状况的话得个人剖析页面来完结转向。需要注重的是,在上面那个标签中url的值也能够是一个相对地址,若是是这样的话,需要对它做一些处置后才能够转发。 

  处置HTTPS协议 

  HttpClient供给了对SSL的撑持,在运用SSL之前有必要装置JSSE。在Sun供给的1.4今后的版别中,JSSE现已集成到JDK中,若是你运用的是JDK1.4曾经的版别则有必要装置JSSE。JSSE不相同的厂家有不相同的完结。下面剖析怎样运用HttpClient来翻开Https衔接。这里有两种办法能够翻开https衔接,第一种就是得到效劳器颁布的证书,然后导入到本地的keystore中;别的一种办法就是经过扩大HttpClient的类来完结主动承受证书。 

  办法1,取得证书,并导入本地的keystore: 

  装置JSSE (若是你运用的JDK版别是1.4或许1.4以上就能够越过这一步)。本文以IBM的JSSE为比方阐明。先到IBM网站上下载JSSE的装置包。然后解压开之后将ibmjsse.jar包拷贝到\lib\ext\目录下。 

  取得而且导入证书。证书能够经过IE来取得:  http://www.aaafaipiao.com/content/show/881.do

  1. 用IE翻开需要衔接的https网址,会弹出如下对话框: 

  2. 单击"View Certificate",在弹出的对话框中挑选"Details",然后再单击"Copy to File",依据供给的导游生成待拜访网页的证书文件 

  3. 导游第一步,欢送界面,直接单击"Next", 

  4. 导游第二步,挑选导出的文件格局,默许,单击"Next", 

  5. 导游第三步,输入导出的文件名,输入后,单击"Next", 

  6. 导游第四步,单击"Finish",完结导游 

  7. 最终弹出一个对话框,显现导出成功 

  用keytool东西把方才导出的证书倒入本地keystore。Keytool指令在\bin\下,翻开指令行窗口,并到\lib\security\目录下,运转下面的指令: 

  keytool -import -noprompt -keystore cacerts -storepass changeit -alias yourEntry1 -file your.cer 

  其间参数alias后跟的值是当时证书在keystore中的仅有标识符,可是大小写不区别;参数file后跟的是方才经过IE导出的证书地点的途径和文件名;若是你想删去方才导入到keystore的证书,能够用指令: 

  keytool -delete -keystore cacerts -storepass changeit -alias yourEntry1 

  写程序拜访https地址。若是想测验能否能连上https,只需要稍改一下GetSample比方,把恳求的方针变成一个https地址。 

  GetMethod getMethod = new GetMethod("your url"); 

  运转该程序能够呈现的难题: 

  1. 抛出反常java.net.SocketException: Algorithm SSL not available。呈现这个反常能够是由于没有加JSSEProvider,若是用的是IBM的JSSE Provider,在程序中参加这样的一行: 

  if(Security.getProvider("com.ibm.jsse.IBMJSSEProvider") == null) 

  Security.addProvider(new IBMJSSEProvider()); 

  或许也能够翻开\lib\security\java.security,内行 

  security.provider.1=sun.security.provider.Sun 

  security.provider.2=com.ibm.crypto.provider.IBMJCE 

  后边参加security.provider.3=com.ibm.jsse.IBMJSSEProvider 

  2. 抛出反常java.net.SocketException: SSL implementation not available。呈现这个反常能够是你没有把ibmjsse.jar拷贝到\lib\ext\目录下。 

  3. 抛出反常javax.net.ssl.SSLHandshakeException: unknown certificate。呈现这个反常标明你的JSSE应该现已装置正确,可是能够由于你没有把证书导入到当时运转JRE的keystore中,请依照前面剖析的进程来导入你的证书。 

  办法2,扩大HttpClient类完结主动承受证书 http://www.aaafaipiao.com/唐山

  由于这种办法主动接纳一切证书,因而存在必定的安全难题,所以在运用这种办法前请细心思考您的体系的安全需要。详细的进程如下: 

  供给一个自界说的socket factory(test.MySecureProtocolSocketFactory)。这个自界说的类有必要完结接口org.apache.commons.httpclient.protocol.SecureProtocolSocketFactory,在完结接口的类中调用自界说的X509TrustManager(test.MyX509TrustManager),这两个类能够在随本文带的附件中得到 

  创立一个org.apache.commons.httpclient.protocol.Protocol的实例,指定协议称号和默许的端口号 Protocol myhttps = new Protocol("https", new MySecureProtocolSocketFactory (), 443); 

  注册方才创立的https协议方针 Protocol.registerProtocol("https ", myhttps); 

  然后依照一般编程办法翻开https的方针地址,代码请拜见test.NoCertificationHttpsGetSample 
[修改本段] 
5 处置署理效劳器 
  HttpClient中运用署理效劳器十分简略,调用HttpClient中setProxy办法就能够,办法的第一个参数是署理效劳器地址,第二个参数是端口号。别的HttpClient也撑持SOCKS署理。 

  httpClient.getHostConfiguration().setProxy(hostName,port); 

posted @ 2013-01-07 00:12  chinadiy197601  阅读(561)  评论(0编辑  收藏  举报