pymongo去重: 插入数据时,不存在则插入,存在则不执行

pymongo去重: 插入数据时,不存在则插入,存在则不执行

爬虫想把爬取的数据存入到mongoDB中, 这时候经常遇到的一个需求就是插入的数据已经存在数据库中, 因此插入前去重就是一个经常性的课题.

我的想法是:

如果数据库中已经存在这个数据, 那么就什么也不操作
如果数据不存在, 则插入这个数据
为了实现这个想法, 查了很多文献, 发现使用update 可以实现

下面就是我测试的代码

# 首先在数据中插入一条数据
document = {
    'p_id': 'f75046d73a0c4bf88f0b7342e60722c4',
    'c_name': 'Ken',
    'c_star': '5.0',
    'bought': None,
    'c_time': '2017年3月23日',
    'c_userful': 13,
    'c_comment': ['4歳になるトイプードル用に購入。', '今までエサは床に食器直置きで与えていましたが、食後にむせていることがたびたび目撃されたので', '「もしかして食べづらいのでは?」と思い調べてみたところ、この商品にたどり着きました。', '足が長いので食事中は頭が完全に下に向いており、胃や足腰に負担がかかっていたと思われます。'],
    'gmt_create': datetime.now().strftime('%Y-%m-%d %H:%M:%S'),
}
collection.insert(document)

通过mongoDB可视化工具查看数据库,发现数据已经存在

要实现如果不存在就插入,如果存在就不插入的要求,我们需要用到 update的一个参数:‘$setOnInsert’
$setOnInsert官方文档点击查看
通过阅读官方文档我们可以发现 与$setOnInsert方法想配合的最重要的参数就是 upsert:True
update源码中的upsert参数默认为False,只需要将update方法的upsert参数修改为True是否就能达到需要的效果呢?
现在我们执行相同数据的插入看看效果

# 首先需要限定一个重复的条件,比如我们想除了gmt_create参数以外,全部不一样就算不重复, 先限定一个条件
result_find = {
    'p_id': 'f75046d73a0c4bf88f0b7342e60722c4',
    'c_name': 'Ken',
    'c_star': '5.0',
    'bought': None,
    'c_time': '2017年3月23日',
    'c_userful': 13,
    'c_comment': ['4歳になるトイプードル用に購入。', '今までエサは床に食器直置きで与えていましたが、食後にむせていることがたびたび目撃されたので',
                  '「もしかして食べづらいのでは?」と思い調べてみたところ、この商品にたどり着きました。', '足が長いので食事中は頭が完全に下に向いており、胃や足腰に負担がかかっていたと思われます。']
}
# 执行 update
collection.update(
    result_find,
    {'$setOnInsert': document},
    upsert=True
)
  • 执行完之后, 去数据库中查看,发现还是原来的那条数据, 并没有多出一条来, 说明可以实现 如果存在就不操作的要求
  • 那么能实现 如果不存在就插入的要求吗?
  • 我们去数据库可视化工具中 把数据库中的数据删除, 然后执行下面操作
document = {
    'p_id': 'f75046d73a0c4bf88f0b7342e60722c4',
    'c_name': 'Ken',
    'c_star': '5.0',
    'bought': None,
    'c_time': '2017年3月23日',
    'c_userful': 13,
    'c_comment': ['4歳になるトイプードル用に購入。', '今までエサは床に食器直置きで与えていましたが、食後にむせていることがたびたび目撃されたので', '「もしかして食べづらいのでは?」と思い調べてみたところ、この商品にたどり着きました。', '足が長いので食事中は頭が完全に下に向いており、胃や足腰に負担がかかっていたと思われます。'],
    'gmt_create': datetime.now().strftime('%Y-%m-%d %H:%M:%S'),
}

result_find = {
    'p_id': 'f75046d73a0c4bf88f0b7342e60722c4',
    'c_name': 'Ken',
    'c_star': '5.0',
    'bought': None,
    'c_time': '2017年3月23日',
    'c_userful': 13,
    'c_comment': ['4歳になるトイプードル用に購入。', '今までエサは床に食器直置きで与えていましたが、食後にむせていることがたびたび目撃されたので',
                  '「もしかして食べづらいのでは?」と思い調べてみたところ、この商品にたどり着きました。', '足が長いので食事中は頭が完全に下に向いており、胃や足腰に負担がかかっていたと思われます。']
}

# collection.insert(document)
collection.update(
    result_find,
    {'$setOnInsert': document},
    upsert=True
)
  • 然后我们发现数据中出现了我们想看到的这条数据
  • 所以, 实现了我们的要求: 存在则不操作, 不存在则插入.


————————————————
版权声明:本文为CSDN博主「景霄之上」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。
原文链接:https://blog.csdn.net/weixin_44285988/article/details/99448931

您可能还喜欢...

发表回复