本文中的步骤基于Windows11的 Linux 子系统
```python import pandas as pd
本文的作者 Hoberg 在 2016年的 Journal of Political Economy 提出了一种新的对公司进行分类的方法. 作者通过网络爬虫收集了许多年份美国上市公司的 10-K 披露文件中的产品描述(里面包含了产品的细节, 对公司之间计算相似度, 进一步进行行业分类.
这篇博客解答了上一篇博客遗留的问题, 介绍了在浏览器中调试类似的数据加载网页,并讲解了如何用Python的requests库来编写代码,不断地获取网站后端返回给我们的数据。 本教程用到的技术栈: Python 文本读写 JSON数据的处理 异常处理 模拟浏览器发送请求 网页 F12调试发现网页规律
本文在已有原始数据的基础上, 使用正则表达式regular expression, 提取投资者和上市公司高管之间的有趣问答. 据观察, 这种基础性的自然语言处理技巧被广泛地运用在部分财经媒体的AI新闻模块