好久没写代码了,真是恍如隔世啊。
好久没写代码了,真是恍如隔世啊。
呜呜呜,没想到时隔一年俺居然还有写爬虫的时候,虽然是个简单的需求,但是还是记录一下吧,毕竟以后俺也未必有机会写代码了。
起源是海洋师兄让我复现一个公司做的生信分析,据说这样一个东西收费1w+,于是我开始尝试进行探索。
最近在学习一些WEB相关知识,这篇博文用于记录一些知识点,基于Django2.2来编写。
在数据挖掘中有很多地方要计算相似度,计算相似度有欧几里德距离、曼哈顿距离、皮尔逊相关度、Jaccard系数和Tanimoto系数等等,这里暂时列出以下几种计算方法。
今年年初时答题游戏比较火,对于一些比较热门的游戏,已经有不少成熟的辅助程序了。然而这个实验室同学转给我的这个小程序,似乎热度还达不到做辅助的标准,而题目又比较恶心,自己答起来比较费劲,所以在这里探讨一下作弊的思路。
最近在项目中需要将SMILES转成InChiKey,通常可以在OpenBabelGUI中操作完成,但是对于大量数据在OpenBabelGUI中操作就有些不方便且容易失误。这里记录一下我解决这个问题的过程。
你用过搜索引擎吗?输入一个单词或者一个单词的一部分,搜索引擎就会自动补全查询词项。用户甚至事先都不知道搜索引擎推荐的东西是否存在,反而会去查找推荐词项。那么这些推荐词项是如何被搜索引擎找到的?那是因为研究人员使用了FP-growth算法,它是基于Apriori构建的,但完成相同任务时将数据集存储在一个特定的称作FP树的结构之后发现频繁项集或频繁项对,即常在一起出现的元素项的集合FP树。这是一种比Apriori执行速度更快的算法,能高效地发现频繁项集,但不能用于发现关联规则。