海量数据处理专题(一)面试百度,腾讯,雅虎。。的利器

2010-10-02 22:17

海量数据处理专题(一)面试百度,腾讯,雅虎。。的利器

by 码农1946

at 2010-10-02 14:17:00

original http://www.cnblogs.com/pkuoliver/archive/2010/10/02/mass-data-topic-1.html


作者: 码农1946 发表于 2010-10-02 14:17 原文链接 阅读: 8279 评论: 10

  大数据量的问题是很多面试笔试中经常出现的问题,比如baidu google 腾讯 这样的一些涉及到海量数据的公司经常会问到。
  下面的方法是我对海量数据的处理方法进行了一个一般性的总结,当然这些方法可能并不能完全覆盖所有的问题,但是这样的一些方法也基本可以处理绝大多数遇到的问题。下面的一些问题基本直接来源于公司的面试笔试题目,方法不一定最优,如果你有更好的处理方法,欢迎与我讨论。


  本贴从解决这类问题的方法入手,开辟一系列专题来解决海量数据问题。拟包含 以下几个方面。
  1. Bloom Filter
  2. Hash
  3. Bit-Map
  4. 堆(Heap)
  5. 双层桶划分
  6. 数据库索引
  7. 倒排索引(Inverted Index)
  8. 外排序
  9. Trie树
  10. MapReduce

在这些解决方案之上,再借助一定的例子来剖析海量数据处理问题的解决方案。

 

其实在园子里面好多类似的面试题都可以用这样的方法来解答,比如百度的TopK热门查询问题,某日IP最多访问问题。

把这类问题研究好了,面试像百度,腾讯这样的公司就完全没问题了!!!

评论: 10 查看评论 发表评论

程序员找工作,就在博客园


最新新闻:
· 《The Social Network》首映周末2300万票房登顶(2010-10-04 12:11)
· 腾讯深陷窥私门危机调查:360发起隐私保卫战(2010-10-04 11:26)
· 微软关闭了通往心门的那扇窗(2010-10-04 11:24)
· 揭穿腾讯QQ偷窥6亿用户隐私的三大阳谋(2010-10-04 11:17)
· 阿迪达斯指责苹果太霸道 退出iAd广告计划(2010-10-04 11:08)

编辑推荐:2010年10月编程语言排行榜:Java的混乱之治

网站导航:博客园首页  个人主页  新闻  闪存  小组  博问  社区  知识库