用tf-idf算法找到与一个文档相似的其他文档。首先要统计出这些文档中出现的所有词,计算每一个文档中词的tf值,tf是用一个文档中出现词w的个数初一文档的总次数,除以总词数是为了进行归一化处理。之后计算idf值,用文档的总数除以包含该词的文档数,最后对得到的商取对数,如果包含词的文档越少,idf值就越大,说明该...