本书自1989年首次出版以来,曾于1994年、1999年、2003年、2008年和2013年分别出了修订版。在2006年本书通过了教育部的评审,被纳入普通高等教育“十一五”国家级规划教材;2008年出版的第5版获得了教育部2009年精品教材称号。2013年出版的第6版是“十二五”普通高等教育本科国家级规划教材。
目前2017年发行的第7版又在第6版的基础上进行了一些修订。 全书分为9章,比较全面系统地介绍了计算机网络的发展和原理体系结构、物理层、数据链路层(包括局域网)、网络层、运输层、应用层、网络安全、互联网上的音频/视频服务,以及无线网络和移动网络等内容。各章均附有习题(附录A给出了部分习题的答案和提示)。
本书的特点是概念准确、论述严谨、内容新颖、图文并茂,突出基本原理和基本概念的阐述,同时力图反映计算机网络的一些最新发展。本书可供电气信息类和计算机类专业的大学本科生和研究生使用,对从事计算机网络工作的工程技术人员也有参考价值。
本书是Android自动化测试领域的里程碑著作,由腾讯最早专注APP测试的腾讯移动品质中心(TMQ)官方出品,系统总结了该团队7年多来在QQ浏览器、应用宝等多款亿级APP的自动化测试中总结出来的方法与经验。旨在帮助测试人员借助本书内容和开源工具,结合项目实际需求,轻松开展自动化测试工作,搭建适用的自动化测试体系。
具体内容分为两个部分:
第一部分?Android自动化测试技术
结合腾讯自身和其他互联网公司的自动化框架使用情况,选择了有代表性的4个开源框架(Monkey、Robotium、UIAutomator、Appium)进行重点讲解,循序渐近、由浅入深,引导读者全面理解框架的原理、用法及高级功能,使读者能轻易上手。
第二部分?Android自动化测试实战
主要以QQ浏览器(Android)、应用宝(Android)、地图等产品为例,涵盖单元测试、功能测试、性能测试、测试覆盖率分析、兼容性测试等内容,并给出开源框架的二次开发应用,提供了具体细致的解决方案,具有极高的参考价值。
在当前复杂的大规模系统场景下,好的应用程序性能比以往任何时候都更重要,但是获得这样的性能也更加困难。Linux由于其开源特性,已经具有一系列优化工具,只是这些工具散布在互联网上,工具的相关文档也很少,只有少数专家知道如何综合使用这些工具来解决实际问题。基于此,菲利普G.伊佐特著贺莲、龚奕利译的《Linux性能优化/Linux\Unix技术丛书》介绍了当前常用的Linux优化工具,展示了它们是如何行之有效地提升整体应用程序性能的。通过真实案例,向开发人员演示了怎样定位影响性能的源代码行,使系统管理人员和应用程序开发人员能够迅速深入系统瓶颈,实施解决方案。
通过阅读《Linux/Unix技术丛书:Linux性能优化》,你能够:
在不熟悉底层系统的情况下,快速识别系统瓶颈。
针对具体问题,找到并选择正确的性能工具。
深入理解系统性能及优化问题。
掌握优化系统CPU、用户CPU、内存、网络I/O和磁盘I/O的方法,并了解它们之间的关系。
掌握修复计算密集型(CPU-bound)、延迟敏感和I/O密集型(I/O—bound)的应用程序的方法,跟随案例轻松地配置自己的环境。
安装并使用Linux系统的高级全系统分析器——oprofile。
无论读者的技术背景如何,性能优化的新手都能通过学习《Linux/Unix技术丛书:Linux性能优化》,掌握一系列清晰实用的优化原则和策略,并获得丰富的Linux知识,解决Linux系统和应用程序的优化问题,增加商业价值并提高用户满意度。
本书从分析大量的互联网产品细节创新设计案例入手,总结出一套对实际工作具有指导意义的细节创新方法论,再对细节创新的实际作用做了研究,为进行怎样的细节创新才有价值这一问题树立了评判标准。全书共9章。第1章列举了三个案例,由此引出本书需要回答的两个主要问题——“细节创新能否有理论指导”和“什么样的细节创新才是有价值的”。第2~5章分门别类地归纳总结了四种细节创新的成熟方法,包括用户行为预判、场景化设计、恰到好处的提示、让得到比预期更多,即对第壹个问题的解答。第6章针对创新的“抄袭”和成本控制问题进行了探讨,并分析了传统行业中同样适用本书方法论的细节创新案例,即对第壹个问题的扩展解答及对第二个问题的简单回答。第7~9章通过探讨创新在企业发展战略中的地位与价值、细节创新的取舍与优化组合等问题,对初创企业和成熟企业的创新分别提出了解决方案,即对第二个问题的深度分析解答。本书是作者经过多年收集、总结、思考后的结晶,对于创新活动兼具较高的理论价值和实用价值,各行各业均值得借鉴和参考,尤其适合互联网公司产品经理、创业者等阅读。
本书将介绍如何使用Python编写网络爬虫程序获取互联网上的大数据。本书包括三部分内容:基础部分、进阶部分和项目实践。基础部分(第1~6章)主要介绍爬虫的三个步骤(获取网页、解析网页和存储数据),并通过诸多示例的讲解,让读者从基础内容开始系统性地学习爬虫技术,并在实践中提升Python爬虫水平。进阶部分(第7~12章)包括多线程的并发和并行爬虫、分布式爬虫、更换IP等,帮助读者进一步提升爬虫水平。项目实践部分(第13~16章)使用本书介绍的爬虫技术对几个真实的网站进行抓取,让读者能在读完本书后根据自己的需求写出爬虫程序。无论是否有编程基础,只要是对爬虫技术感兴趣的读者,本书就能带领读者从入门到进阶,再到实战,一步步了解爬虫,终写出自己的爬虫程序。
树莓派从2012年发行一个版本以来,由于其通用的架构、标准的接口和丰富的外围设备,吸引了无数硬件和软件工程师的眼球,将其视为投身物联网产业的必备法宝之一。本书详细讲解了如何将传感器集成到树莓派电脑板,创建令人难忘的交互式项目,并用Linux和Python深入挖掘树莓派的功能,为那些希望了解各种硬件和软件如何协同工作以及希望得到在树莓派上开发传感器和物联网项目的创造者们提供实用指南。
全书分为7章:第1章介绍市面上可找到的所有型号的树莓派,包括*新发布的B型树莓派,并讨论安装操作系统的方法以及将树莓派接入互联网的几种有趣的方式;第2章简要介绍树莓派的电子学基本知识;第3~7章则通过5个不同的项目分别详细讲解如何利用树莓派和传感器测量距离、监控温度和湿度、连接树莓派和传感器、在线上传数据以及图像与视频处理。书中最后的附录给出一份购物清单,可以作为读者进行项目开发时选购相应工具和元器件的参考。
在移动互联网、云计算、物联网以及大数据发展日益迅速的今天,传统企业面对一些新兴营销模式,如O2O、微信营销、网络支付等,所感受到的迷失和迷茫,对传统渠道管理和费用控制的力不从心,对顾客消费模式变化以及忠诚度的空泛理解等,都促使我们必须对传统经典营销模型进行思考和调整,以满足众多企业在营销模式和经营策略方面的急切需要。
移动时代发展、产业转型升级、消费特点变革,要求管理人员从新的视角来审视和思考品牌与用户的关系,策划和开展更为有效的移动互联营销,本书的4D模型提供了这种新视角。4D模型的构成要素包括:关注用户的真正需求(Demand)、向客户快速传递价值(Deliver)、跟客户保持动态沟通(Dynamic)以及基于大数据的决策(Data)。在此基础上借助大数据、平台化、跨行业等互联网思维重塑企业经营管理模式和价值传递渠道,通过社会化渠道管控全面建设和强化企业的运营能力,使企业初步具备全渠道销售能力,并通过协同线上线下业务、优化运营模式实现营销模式的互联网转型,形成全渠道价值链。
《轻营销》,中国第一本全面讲述如何在互联网新时代用小预算做大营销的书籍,以求把中小微企业从那些以大预算为基础而难以落地的营销理论和案例中解脱出来。用"轻"但真正起作用的方法,帮助传统企业抓住互联网新一波浪潮的机遇,转型升级。
《轻营销》,中国第一本全面讲述如何在互联网新时代用小预算做大营销的书籍,以求把中小微企业从那些以大预算为基础而难以落地的营销理论和案例中解脱出来。用“轻”但真正起作用的方法,帮助传统企业抓住互联网新一波浪潮的机遇,转型升级。
“怒打价格战、拼命砸广告、渠道金字塔”是过去中国企业做营销的基本功课,背后的逻辑是花钱。今天这三招已经不太管用了,广告费用的多少不再是决定性因素。取而代之的是直面客户的应用性场景、从解决问题的角度着手展开的营销方式,这其中向用户传递的任何价值,都有其意义。告别广播式的推广,转用射箭式的方法瞄准目标狠命打,这是《轻营销》提倡的新逻辑,俱以实例为证,值得一阅。
让网站和应用更快速、更简洁、更稳健,从而有效提升用户体验,这无疑是众多开发者梦寐以求的。然而互联网发展日新月异,HTTP/1.1协议已经难以满足现今的需求。在众多Web性能提升方案中,HTTP/2值得尝试。
本书是HTTP/2实用指南,介绍了HTTP/2的设计初衷和新特性,以及如何才能充分利用这些特性来打造高性能网站及应用。作者用定量分析方法,对比了不同网络环境下及不同浏览器上HTTP/1.1与HTTP/2的性能差异,并指出了网站迁移到HTTP/2需要注意的问题及对策。
本书主要内容:
HTTP发展回顾——面临性能挑战,促使协议升级
HTTP/2概览——优点及迁移方法
既有的建议方案,以及提升Web性能的技巧
HTTP/2支持的浏览器、服务器、代理,以及内容分发网络
相比于HTTP/1.1,采用HTTP/2的网站在性能上有何提升
HTTP/2对网络通信中一些具体问题的改进,如延迟、丢包、首字节时间等
互联网公司的超速发展,以及对传统产业越来越猛烈的变革,让“焦虑“成了很多传统行业企业家的新常态。举一个极端的例子:在中国,一年血压计的销量大约是1000万台;但是,很可能在不远的将来,这个行业中的绝大多数玩家将会死去,因为有人会免费送出数百万台血压计。是谁这么大方?难道是 疯了吗?
答案当然是否定的。更让人想不明白的是,这家公司不但没有倒闭,反而成为一家价值超过十亿美金的公司。这虽然起源于一个疯狂的想法,但是当它变成现实的时候,一定是个天才的设计,基于万物互联和互联网的商业逻辑。这个逻辑,在本书中会得到清晰而完整的展示,并用故事的形式表达出来,让即使没有互联网基础的企业家也能轻松读懂,为自己企业的战略转型提供强有力的思想支持。
近30位最优秀国内一线年轻投资人的投资故事,他们的平均年龄在30多岁,总体有三个特点:一是以早期投资为主;二是以TMT居多;三是均长期活跃在投资一线。本书希望通过呈现他们的投资风格和投资策略,记录下中国互联网大潮中那些激动人心的时刻,同时解密互联网创业和投资的逻辑,对读者有所启发。
本书特色:
国内资深Hadoop技术专家实践经验结晶,完全从企业实际生产环境和需求出发,旨在帮助企业真正解决大数据的落地问题;
系统介绍HBase的功能使用、框架设计、基本原理和高级特性;详细讲解使用HBase设计大型数据应用系统的实践方法和技巧;深刻总结系统运维、监控和性能调优的最佳实践。
本书强调HBase在企业的实际应用,立足于企业的实际生产环境,旨在帮助企业切实解决大数据技术如何落地的问题。三位作者都是奋战在中国大数据技术一线的实践派专家,本书是他们实践经验的结晶。
本书内容在三个维度上具有重要特色:功能维度,从HBase的安装配置、参数设置,到数据模型、表结构设计、客户端使用、高级特性,本书做了系统且详尽的介绍;实战维度,不仅通过3个典型的应用案例详细讲解了如何使用HBase设计大型的数据应用系统,而且还结合实际生产系统讲解了HBase的集群运维、监控和性能调优;理论维度,则深入分析了HBase、框架设计、模式设计和基本原理。可谓是理论与实践完美结合,深度与广度兼备!
【名家推荐】
本书作者在Hadoop开发和运维领域工作近4年,积累了丰富的经验,同时也对Hadoop技术人员在学习过程中可能会遇到的问题有一定的了解,在此基础上写了这本书。从如何用好HBase出发,首先介绍设计原理和应用场景,让读者了解HBase适合什么场景不适合什么场景,然后再介绍应用编程、性能优化和生产环境中的运维经验,可谓由浅入深,循序渐进,值得推荐!
—— 查礼 博士
中国大数据技术大会(原Hadoop in China)主席,中国计算机学会大数据专家委员会委员,中科院计算所副研究员
近几年,大数据和开源越来越受到各行各业的关注,而作为大数据中不可替代的重中之重,Hadoop及其周边生态,也逐渐从互联网公司向传统行业过渡。本书的几位作者都是在Hadoop与大数据领域深入工作多年的践行者,既有丰富的理论知识,又有多年工作的实战经验。本书着重介绍了HBase的工作原理和设计架构,同时在实际工作的应用场景上亦着墨很重,大数据的神秘不仅仅在于具体的技术细节,更多的是由于它是个新生事物,很多人并不很清楚大数据的技术架构应如何设计,应用场景如何,而我这几位好友结合自己在实际工作中的宝贵经验,通过撰写本书为广大爱好者解答了这一难题。本书是不可多得的理论与实践完美结合的技术书籍。
—— 向磊 phphiveadmin作者,汉云数衍创始人
大数据的概念已经逐渐深入人心,从互联网行业到传统行业,已经掀起一股“数据驱动商业价值”的热潮。大数据需要落地,需要开源技术来驱动新一轮的变革,而HBase作为大数据落地过程中的神兵利器,已经一次又一次证明了其巨大价值。本书不同于其他HBase的翻译版书籍,由来自国内互联网最前沿的实战派资深人士撰写而成,融合了自身的实战经验,更契合中国企业应用HBase技术的实情。本书由浅入深,结合理论阐述与案例剖析,如同一壶香茶,值得细细品咂。
—— 数盟社区 致力于为推崇“数据价值”的企业及个人打造最好的数据科学交流平台
在现今的互联网公司中,产品线绵延复杂,安全防御体系无时无刻不在应对新的挑战。哪怕是拥有丰富工作经验的安全从业者,在面对层出不穷的攻击手段和海量日志数据时也会望洋兴叹。机器学习、深度学习是这些问题天然契合的解决方案,在数据量以指数级不断增长的未来,甚至有可能是唯一的出路。当AI遇到安全时,如何快速进化,本书给出了实战方案。 本书是《Web安全之机器学习入门》之后又一作品。本书首先介绍如何打造自己的深度学习工具箱,包括TensorFlow、TFLearn等深度学习库的安装以及使用方法。接着介绍卷积神经网络和循环神经网络这两大深度学习算法的基础知识。特别着重介绍在生产环境搭建深度学习平台需要使用的开源组件,包括Logstash、Kafka、Storm、Spark等。随后讲解了11个使用机器学习技术解决实际安全问题的案例,包括验证码识别、垃圾邮件识别、负面评论识别、骚扰短信识别、Linux后门检测、恶意操作行为检测、Webshell检测、智能扫描、DGA域名检测、恶意程序分类识别、反信用卡欺诈。本书针对每一个算法都给出了具体案例,理论结合实际,讲解清晰,文笔幽默,适合有信息安全基础知识的网络开发与运维技术人员参考,主要内容包括:
- 如何基于TensorFlow和TFLearn打造自己的深度学习工具箱。
- 如何基于Logstash、Kafka、Storm、Spark等打造深度学习的生产环境。
- 如何在MNIST数据集上实现验证码识别。
- 如何在安然数据集上实现垃圾邮件检测。
- 如何在IMDB数据集上实现负面评论识别。
- 如何在SMSSpamCollection数据集上实现骚扰短信识别。
- 如何在ADFA-LD数据集上实现Linux后门检测。
- 如何在SEA数据集上实现恶意操作行为检测。
- 如何在MIST数据集上实现恶意程序分类识别。
- 如何在Kaggle公开的数据集上实现信用卡欺诈检测。
- 如何在GitHub公开的数据集上实现Webshell检测,智能扫描和DGA域名检测。
编辑推荐
移动互联网让网络文明回归社群时代,魅力人格体、粉丝经济、参与感、协同、场景、连接等都是社群时代的重要标签,社群时代让我们每个人和每个品牌都有机会找到与消费者连接的便捷路径。如果你善于经营社群,无论你是企业,还是个人,你都将会取得巨大的成功,小米和罗辑思维就是好的例证。我们究竟应该如何去经营社群?
卢彦、纳兰所著的《社群+(互联网+企业行动路线图)》分为三篇,分别为取势篇、明道篇和践行篇,通过社群时代的商业逻辑、社群经济、社群落地的途径、社群起源、社群方法论、社群商业生态等角度深度解构了社群时代的营销、运营、商业模式与商业法则。
当前IT领域的概念层出不穷,云计算、物联网、移动互联网、大数据、人工智能、VR,所有的这一切都基于IT系统,IT系统正在向规模更大、更复杂、更高级的方向演进,一切IT资源都掌握在运维手里,通过运维来操作。这个时代对运维的要求越来越高,运维如果稍有不慎,就会造成重大的损失,所以随着IT系统的发展,运维的重要性也越来越高。根据量子力学理论,世界由基本粒子组成,因此世界是不连续的,这个理论在运维知识体系的建立上同样适用。仔细回想一下自己运维体系的建立,就是逐个攻克和掌握知识点,再进一步通过实践不断加深的过程。《运维前线》也是这样,其中的每一篇文章都能够协助读者更快地掌握一个或多个知识点,相信通过运维前线系列的逐步出版,终能够覆盖更多的运维知识点,为读者带来更多的实践经验和理念。
虽然互联网带来的时代变革才刚刚开始,但产业互联网时代已经到来,放眼全球,发达国家利用技术优势,已然开始行动。在欧洲,德国提出了“工业4.0”战略,试图摸索未来工业生产的新途径;在美洲,美国政府喊出了“再工业化”“能源互联网”等口号,发动了以“工业互联网”为代表的一系列“先进制造业”计划;而在亚洲,日本、韩国也利用智能技术正在迎头赶上。
德国工业4.0是把工厂、机器、生产资料和人通过网络技术高度联结,形成自组织的生产,其内涵已经远远超越机器的自动化。西门子的“数字化企业平台”系统为数字制造提供了载体;宝马的虚拟手势识别系统让制造汽车酷炫好玩;大众早已用机器人制造汽车,大大解放了工人的劳动力;高智能、高性能的库卡机器人游走在各种工厂之中;博世的射频码系统让智能工厂跃然眼前……百年底蕴的德国制造散发出未来之感。
工业4.0不仅为中国的工业生产提供了一种全新思路,而且与中国国策“两化融合”(工业化与信息化深度融合)战略不谋而合。新一届中国政府鼎力推荐工业4.0,工信部快马加鞭制定“中国制造2025”,都是为了使工业4.0能顺利落地中国,并开花结果,升级“中国智造”,调整就业的结构性失衡。中国版“工业4.0”——“中国制造2025”是我们未来十年的国之大略。
工业4.0,正在发生的未来……
本书是国内首本系统论述互联网思维的书籍,全面揭秘互联网七字诀“专注、极致、口碑、快”,结合当前的最热事件与高速成长企业背后的成功法门,深刻而系统地解析12大核心互联网思维:标签思维、简约思维、NO.1思维、产品思维、痛点思维、尖叫点思维、屌丝思维、粉丝思维、爆点思维、迭代思维、流量思维、整合思维。
本书通过剖析轻资产公司对传统巨型公司的颠覆、快公司对慢公司的颠覆、产业下游公司对产业上游公司的颠覆,系统化地分析如何从小企业快速发展成大企业,大中型企业在发展滞后的情况下如何突破现状,全面掌握互联网思维的真谛。
本书是企业成长的必备参考书,适合每一位致力于企业快速成长及提升自身综合实力的职场人士阅读,对初创企业、在互联网方面涉足不深,以及处在发展缓慢状态的公司都有极大的启示作用。
高效的财报阅读方法:如何从浩如烟海的数据中挖掘与投资最相关的信息
独创的核心选股工具:通过收入和利润增长率的四个象限、十六种变化锁定目标
详尽的实战分析案例:万福生科的造假分析、贵州茅台的数据支撑、乐视网财报谜团的新解、facebook等互联网公司的估值方法……
真实的投资心得分享:在2007年高点入市,缘何还能获得可观收益
在股市中,没有一种绝对的方法保证你赢,但我们终究需要一种方法来指导投资,在这个充满变数的股票世界里,获得财富的持续增长。不用惧怕庄家内幕,不用担忧政策风险,我们所能做的是建立自己的股票投资思想体系和操作框架系统,独立于自己的情绪。比别人更善于思考,更善于运用财务工具和财务数据,在不确定中寻找最大概率的确定性投资,实现规律性盈利,这样,我们才能比别人走得更远一些。
这是一本讲述在移动互联网时代如何构建和运营社群的实操性著作。本书对社群相关的概念进行了系统的介绍,讲解了社群经济,详述了社群的组建、运营和营销,讲解了社群商业及社群化管理。全书以国内著名的社群——酣客公社为例,再现了一个社群是如何从0到100的。
经过几年的"野蛮"式发展,中国很多O2O企业都遭遇了发展瓶颈,大多数希望通过O2O来实现互联网转型的企业步履维艰。亿邦动力作为国内权威的电商门户,在O2O领域有着深厚的积淀,从行业和企业两个维度对中国的O2O现状有着深入且全面的认识、理解,深谙企业当下面临的难题。
榜样是最好的老师,为了帮助广大企业突破O2O的瓶颈和困局,亿邦动力决定挖掘和总结成功企业的O2O实践经验,以供借鉴。他们精心挑选了目前对O2O需求最为广泛且发展相对成熟的近10个行业的10家模范企业,并进行了专门走访和深入调研。他们带着对行业的认知和企业的共性问题,深入到这些企业内部,直接与企业的O2O操盘团队面对面交流,抽丝剥茧,层层深入,用专业的"复盘"方法,从思想、观点、战略、战术、流程、方法等多个维度对企业的O2O实践进行了系统性整理和回顾,从而著成本书。本书不仅能让我们了解这些企业在O2O实践中为什么会成功,还能让我们知道他们一步步是如何做的,实践指导意义极强。
复盘过程中,本书将重心放在了这些企业的O2O模式和具体的操盘方法上,在系统、全面回溯这些企业是如何做的同时,也对这些企业所在行业的O2O痛点和实践方法进行了总结,由具体到抽象,能够引发更多的思考。
《网络数据采集技术:Java网络爬虫实战》是国内上很少见的讲解Java语言(而不是Python语言)网络爬虫的书籍。与Python语言相比,使用Java语言进行网络数据采集,具有采集效率更高、框架性能更好、敏捷易用等优点,而且针对大型搜索引擎系统的数据采集工作更多使用Java语言,故本书值得读者学习。编程语言的初学者也可通过本书进一步掌握Java语言的高级编程技能。
内容提要
《网络数据采集技术:Java网络爬虫实战》以Java为开发语言,系统地介绍了网络爬虫的理论知识和基础工具,包括网络爬虫涉及的Java基础知识、HTTP协议基础与网络抓包、网页内容获取、网页内容解析和网络爬虫数据存储等。本书选取典型网站,采用案例讲解的方式介绍网络爬虫中涉及的问题,以增强读者的动手实践能力。同时,本书还介绍了3种Java网络爬虫开源框架,即Crawler4j、WebCollector和WebMagic。
《网络数据采集技术:Java网络爬虫实战》适用于Java网络爬虫开发的初学者和进阶者;也可作为网络爬虫课程教学的参考书,供高等院校文本挖掘、自然语言处理、大数据商务分析等相关学科的本科生和研究生参考使用;也可供企业网络爬虫开发人员参考使用。
媒体评论
海量数据的出现催生了一种新的科研模式,即从数据中直接查找或挖掘所需要的信息。网络数据采集是商务、金融、公共管理等领域进行大数据分析的基础。本书系统梳理了网络数据采集的理论和基础知识,通过实际案例描述了网络数据采集技术的实现流程。基于本书的学习,读者可轻松开发一些数据采集项目,获取所需要的网络数据。
清华大学教授、博士生导师 陈国青
数据采集是数据处理的首要环节,也是发掘和利用数据价值的基石。网络数据作为数据的重要来源,其采集手段多为网络爬虫。本书依托作者团队所承担的国家自然科学基金重大项目在数据采集方面的研究成果,系统地介绍了其相关技术(均得到实践验证),能够很好地帮助数据采集技术的初学者和进阶者。
中国科学院计算技术研究所研究员、博士生导师 程学旗
数据作为一种重要资源,对创新社会治理、经济转型升级、科技创新能力提升的作用显著。采集数据是实现数据价值的基础性工程,受到社会各界的高度重视。本书提供了多个网络数据采集项目的详细代码,并附有注释,便于读者理解与进行实际项目的开发。
上海数据交易中心项目总监 卓训方
对于大学生,以及从事数据挖掘、数据商务分析等相关研究的硕士生和博士生而言,网络数据采集已是一项必备技能。本书详细介绍了Java网络爬虫技术所涉及的一系列工具,同时也介绍了一些流行的网络爬虫开发框架,非常适合莘莘学子参考使用。
合肥工业大学教授博士、生导师 刘业政
前言
近几年,网络空间大数据(Big Data)已成为各领域研究的热门话题。在企业应用方面,天猫利用海量的用户数据挖掘年轻消费者偏好,并将用户偏好反馈给手机研发部门,将其用于手机设计;汽车之家利用平台中用户生成的大数据对用户进行画像,在此基础上开展个性化营销。在学术界,很多领域的学者针对大数据衍生出的新问题开展学术研究,如大数据驱动的客户洞察、大数据驱动的个性化推荐、大数据驱动的管理决策等。
在网络大数据环境下,数据采集尤为重要。因此,很多企业都提供了(高级)数据采集工程师的职位。对于很多在校大学生而言,尤其是硕士生和博士生,网络数据采集是一项必备的技能。
在编写本书之前,笔者主要从事数据采集系统的设计与开发工作。在CSDN 社区上,笔者撰写过一系列介绍Java 网络爬虫的博客,这些博客为笔者的主页带来了不少访问量;同时,也有许多博客读者通过邮件的方式,向笔者咨询网络爬虫相关的工具使用、程序调试等问题。为此,笔者对Java 网络爬虫所涉及的知识与技术进行了系统的梳理,并打算编写一本关于Java 网络爬虫的书籍。在写作过程中,笔者与具有丰富网络爬虫教学经验的姜元春教授就写作逻辑、介绍的知识点、使用的案例等多方面的内容进行了多次讨论。本书的内容更加注重爬虫理论、开发基础与实战演练。基于对本书爬虫案例的研读,读者可以快速开发自己需要的其他网络爬虫程序。
本书的内容
本书分为9 章,具体内容如下所示。
第1 章至第3 章:这3 章重点介绍与网络爬虫开发相关的基础知识,其中包括网络爬虫的原理、Java 基础知识和HTTP 协议等内容。
第4 章至第6 章:这3 章分别从网页内容获取、网页内容解析和网络爬虫数据存储3 个方面介绍网络爬虫开发过程中所涉及的一系列技术。在这3 章中,涉及很多开源工具的使用,如Jsoup、HttpClient、HtmlCleaner、Fastjson、POI3 等。
第 7 章:本章利用具体的实战案例,讲解网络爬虫开发的流程。通过对本章的学习,读者可以轻松开发Java 网络爬虫。
第8 章:针对一些复杂的页面,如动态加载的页面(执行JavaScript 脚本),本章介绍了一款实用的工具——Selenium WebDriver。
第9 章:本章重点介绍了3 种比较流行的Java 网络爬虫开源框架,即Crawler4j、WebCollector 和WebMagic。读者可根据数据采集需求,自行开发支持多线程采集、断点采集、代理切换等功能的网络爬虫项目。
本书的特色
注重基础:俗话说,基础不牢,地动山摇。本书从可读性和实用性出发,重点介绍了网络爬虫中涉及的基础知识。
系统性:本书系统地梳理了网络爬虫的逻辑和开发网络爬虫需要掌握的技术。对网络爬虫初学者和进阶者而言,学习这些内容将有利于解决数据采集过程中遇到的各种问题。
详细的案例讲解:本书选取了较为典型的网站,讲解网络爬虫经常遇到的问题,如HTTPS 请求认证问题、大文件内容获取问题、模拟登录问题、不同格式文件(文本、图片和PDF 等)的存储问题、定时数据采集问题等。
开源框架: 本书介绍了3 种Java 网络爬虫开源框架,即Crawler4j、WebCollector和WebMagic。通过对这3 种网络爬虫开源框架的学习,读者可以轻松开发一些高性能的网络爬虫项目。
完整的代码:为便于读者学习,对于每个数据网络爬虫项目,笔者都提供了完整的代码,并且在代码中给出了清晰的注释。
适合的读者
Java 网络爬虫开发的初学者和进阶者。
科研人员,尤其是从事网络大数据驱动研究的硕士生和博士生。
开设相关课程的高等院校的师生。
企业网络爬虫开发人员。
说明
网络爬虫作为一项技术,更应该服务于社会。在使用该技术的过程中,应遵守Robots 协议(互联网行业数据抓取的道德协议)。同时,需要注意对数据所涉及的知识产权和隐私信息进行保护。另外,采集数据时,需要注意礼貌,即不频繁地请求网页,以防止给数据提供者的服务器造成不良影响。在使用所采集的数据时,需要注意是否涉及商业利益和相关法律。最后,本书中所有使用的案例皆为测试案例,仅供读者学习使用,本书中的URL 均做了处理。
基金项目
本书由国家自然科学基金重大项目课题“面向大数据的商务分析与计算方法以及支撑平台研究(71490725)”、国家自然科学基金重大研究计划子课题“面向商务领域的大数据资源池及集成示范平台(91746302)”、国家自然科学基金优秀青年基金“个性化营销理论与方法(71722010)”提供资助。
勘误
由于笔者的水平有限,书中难免出现一些错误及不准确之处,恳请读者批评指正。为及时更正书中不恰当的内容,笔者在CSDN 博客中创建了一个板块,读者可以将书中的问题以评论的方式进行反馈,笔者将针对这些问题进行勘误。另外,也欢迎读者通过发送电子邮件(qy20115549@126.com)的方式,反馈书稿的问题。
致谢
感谢电子工业出版社的林瑞和编辑、合肥工业大学电子商务研究所的刘业政教授和孙见山副教授等给本书提出的宝贵建议。
感谢华为的杜非、王佳佳和王锦坤师兄的帮助,是他们将我带入编程的世界。
感谢淮南师范学院的孙娜丽女士对整本书稿写作语言的梳理。
感谢合肥工业大学电子商务研究所的朱婷婷、杨露、田志强、宋颖欣、张雪、李哲、贺菲菲、叶畅、陶守正、梁瑞诚等博士参与本书内容的讨论。
最后,希望热爱网络爬虫开发的小伙伴们能够喜欢本书。
钱 洋
2019 年9 月
《Spark核心源码分析与开发实战》作者是王家林,王雁军,王家虎,是2016机械工业出版社出版的图书,本书主要讲述了Spark技术在国内外的应用越来越广泛,它正在逐渐走向成熟,并在这个领域扮演更加重要的角色。国外一些大型互联网公司已经部署了Spark。
《Android开发完全实战宝典(附光盘)》由吴善财等编著,本书详细讲解了Android技术在各个领域的具体应用,介绍了各个实例的具体实现过程。全书分为10章,第1、2章是基础知识,讲解了Android前景和搭建开发环境的过程;第3章详细讲解了Android在人机交互界面领域典型实例的设计过程;第4章详细讲解了Android各个组件的使用方法;第5章讲解了Android在交互式应用领域的具体应用;第6章讲解了Android在手机自动服务领域中的应用;第7章讲解了Android在娱乐和多媒体领域的具体应用;第8章讲解了Android在互联网领域各个实例的实现过程:第9章讲解了Android在官方服务绑定领域各个实例的实现过程;第10章讲解了Android在绘图和游戏开发领域的具体应用。
《Android开发完全实战宝典(附光盘)》适用于Android的初、中、高级用户,既可以作为初学者的自学手册,也可以作为有一定程序开发基础人员的参考书。
《IP地址管理原理与实践》介绍了将网络管理科学应用到互联网协议地址空间及相关联的网络服务等内容。本书分为四个部分,第Ⅰ部分给出IPv4、IPv6以及IP地址分配和子网划分技术综述;第Ⅱ部分描述用于IPv4和IPv6的DHCP,并解释依赖于DHCP的各项应用、DHCP服务器部署策略以及DHCP和相关的网络接入安全;第Ⅲ部分描述DNS协议、DNS应用、部署策略和相关联的配置以及安全性;第Ⅳ部分描述以聚合方式管理IP地址空间的各项技术和日常IP地址管理功能。
《IP地址管理原理与实践》可作为IP网络规划人员、工程师和管理人员的实践用书,同时可供部署IPv6网络的技术人员参考。
本站基于Calibre构建,感谢开源界的力量。所有资源搜集于互联网,如有侵权请邮件联系。
Github | Docker | Library | Project
本书自1989年首次出版以来,曾于1994年、1999年、2003年、2008年和2013年分别出了修订版。在2006年本书通过了教育部的评审,被纳入普通高等教育“十一五”国家级规划教材;2008年出版的第5版获得了教育部2009年精品教材称号。2013年出版的第6版是“十二五”普通高等教育本科国家级规划教材。
目前2017年发行的第7版又在第6版的基础上进行了一些修订。 全书分为9章,比较全面系统地介绍了计算机网络的发展和原理体系结构、物理层、数据链路层(包括局域网)、网络层、运输层、应用层、网络安全、互联网上的音频/视频服务,以及无线网络和移动网络等内容。各章均附有习题(附录A给出了部分习题的答案和提示)。
本书的特点是概念准确、论述严谨、内容新颖、图文并茂,突出基本原理和基本概念的阐述,同时力图反映计算机网络的一些最新发展。本书可供电气信息类和计算机类专业的大学本科生和研究生使用,对从事计算机网络工作的工程技术人员也有参考价值。