大型网站架构体系的演变

草根时期，快速开发网站并上线。当然，通常只是先试水，用户规模也没有形成，经济能力和投入也非常有限。

有一定的业务量和用户规模了，想提升网站速度，于是，缓存出场了。

市场反响还不错，用户量每天在增长，数据库疯狂读写，逐渐发现一台服务器快撑不住了。于是，决定把DB和APP做分离。

单台数据库也感觉快撑不住了，一般都会尝试做“读写分离”。由于大部分互联网“读多写少”的特性所决定的。Salve的台数，取决于按业务评估的读写比例。

数据库层面是缓解了，但是应用程序层面也出现了瓶颈，由于访问量增大，加上早期程序员水平有限写的代码也很烂，人员流动性也大，很难去维护和优化。所以，很常用的办法还是“堆机器”。

加机器谁都会加，关键是加完之后得有效果，加完之后可能会引发一些问题。例如非常常见的：页面输出缓存和本地缓存的问题，Session保存的问题……

到这里，已经基本做到了DB层面和应用层面的横向扩展了，可以开始关注一些其它方面，例如：站内搜索的精准度，对DB的依赖，开始引入全文索引。

Java领域用的较多的是Lucene、Solr等(SOLR是一个全文索引的引擎)，而php领域用的比较多的是sphinx/coreseek。

这里要大致明白全文索引的原理，就是建立倒排表

到目前为止，一个能够承载日均百万级访问量的中型网站架构基本介绍完了。当然，每一步扩展里面都会有很多技术实现的细节，后续有时间会写文章单独去剖析那些细节。

在做扩展满足了基本的性能需求后，我们会逐渐关注“可用性”（也就是我们通常听别人吹牛时说的SLA、几个9）。如何保证真正“高可用”，也是个难题。

几乎主流的大中型互联网公司，都会有用到类似的架构，只是节点数不同而已。

还有一招用的比较多的，那就是动静分离。可以需要开发人员配合（把静态资源放独立站点下），也可以不需要开发人员配合（利用7层反向代理来处理，根据后缀名等信息来判断资源类型）。有了单独的静态文件服务器之后，存储也是个问题，也需要扩展。多台服务器的文件怎么保持一致，买不起共享存储怎么办？分布式文件系统也派上用场了。