apache-spark - Jupyter Notebook 上未显示结构化流输出-6ren

apache-spark - Jupyter Notebook 上未显示结构化流输出

转载作者：行者123 更新时间：2023-12-03 17:00:35

24

4

我有两本笔记本。第一个笔记本正在使用 tweepy 从 twitter 读取推文并将其写入套接字。其他笔记本正在使用 spark 结构化流 (Python) 从该套接字读取推文并将其结果写入控制台。不幸的是，我没有在 jupyter 控制台上获得输出。代码在 pycharm 上运行良好。

spark = SparkSession \
    .builder \
    .appName("StructuredStreaming") \
    .getOrCreate()
spark.sparkContext.setLogLevel("ERROR")

# This is Spark Structured Streaming Code which is reading streams from twitter and showing them on console.
tweets = spark \
    .readStream \
    .format("socket") \
    .option("host", "127.0.0.1") \
    .option("port", 7000) \
    .load()

query = tweets \
    .writeStream \
    .option("truncate", "false") \
    .outputMode("append") \
    .format("console") \
    .start()

query.awaitTermination()

最佳答案

我不确定 Jupyter Notebook 是否可以做到这一点。但是，您可以使用内存输出来实现类似的结果。这在 complete 中很简单模式，但可能需要对 append 进行一些更改.

对于 complete模式

在 complete输出模式，您的查询应该或多或少如下:

query = tweets \
    .writeStream \
    .outputMode("complete") \
    .format("memory") \
    .queryName("your_query_name") \
    .start()

请注意，没有 query.awaitTermination()在末尾。
现在，查询 your_query_name另一个单元格中的临时表，并根据需要观看不断更新的结果:

from IPython.display import display, clear_output

while True:
    clear_output(wait=True)
    display(query.status)
    display(spark.sql('SELECT * FROM your_query_name').show())
    sleep(1)

对于 append模式

如果您想使用 append输出模式，你必须使用水印。您也将无法使用聚合，因此您的代码可能需要进一步更改。

query = tweets \
    .withWatermark("timestampColumn", "3 minutes")
    .writeStream \
    .outputMode("append") \
    .format("memory") \
    .queryName("your_query_name") \
    .start()

显示代码保持不变。
您也可以显示 query.lastProgress以类似的方式获取更详细的信息。

灵感和引用

How to get the output from console streaming sink in Zeppelin?

Overwrite previous output in jupyter notebook

关于apache-spark - Jupyter Notebook 上未显示结构化流输出，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/61463554/

24

4

0

文章推荐： C# 8.0 不可为空的引用类型和选项模式

文章推荐： swagger - 为 ApiParam 和 ApiQuery 定义 DTO

文章推荐： pine-script - TradingView – Pine Script 中单个订单的多个止盈

jupyter-notebook - pip install jupyter 后找不到 jupyter
在尝试安装 jupyter 的许多不同方法之后，它似乎没有正确安装。根据我最近遇到的 MacOS 系统 python 问题，可能与 MacOS 相关 pip install jupyter --us
jupyter - Jupyter 笔记本的更好命名约定
命名 Jupyter Notebook 时，如果使用空格，即 This is my notebook.ipynb 然后，当使用网络浏览器打开时，它的渲染效果非常好。然而，空格在命令行环境中是有害的。但
jupyter-notebook - `jupyter notebook` 和 `jupyter server` 有什么区别？
运行 jupyter notebook和 jupyter server给我非常相似的结果，描述也非常相似。 ❯ jupyter notebook -h The Jupyter HTML Noteboo
jupyter-notebook - Jupyter Lab 中的 Jupyter Notebook 扩展
是否可以在 Jupyter Lab 中使用笔记本扩展 (nbextensions)？我认为我的扩展已启用...我调用 jupyter nbextension enable事先在他们身上。但我没有在
python - Jupyter 命令仅适用于破折号(例如 jupyter-kernelspec 而不是 jupyter kernelspec)
我将 Jupyter 与 Anaconda3 结合使用。我的 Anaconda3\ 和 Anaconda3\Scripts\ 文件夹已添加到 %PATH% 变量中。尽管 jupyter.exe 位
jupyter - 在页面刷新时运行 Jupyter 单元格
我将 Jupyter 用于我公司的分析。我想制作显示一些漂亮图表的实时页面。我将在大厅的大显示器上显示此页面，我希望它自动刷新。有什么方法可以通过刷新浏览器页面来触发“运行所有单元格”吗？或者，是否
jupyter - %stored Jupyter 文件位于何处？
%store 魔术功能可以保存大型 python 对象，供您在不同 session 之间使用，但我想找出文件的实际位置，以便我也可以在不同 session 之间传输它们不同的电脑。我正在使用 Wind
jupyter-notebook - Jupyter 笔记本上的文本从右到左对齐
我在 Windows 10 的本地 Ubunto 机器上运行 Jupyter notebook。问题是所有文本都与屏幕右侧对齐，包括菜单 - 例如"file"选项卡位于最右侧。以这种方式阅读文本非常困
jupyter-notebook - Jupyter Notebook取消注释的快捷方式
Closed. This question is not reproducible or was caused by typos。它当前不接受答案。想要改善这个问题吗？更新问题，以便将其作为on-t
jupyter-notebook - Jupyter 链接到部分
我尝试使用以下内容创建指向 jupyter 笔记本中标题的内部链接。 SO上的各种答案，例如here在我的笔记本中似乎没有按预期工作。下面的代码创建了一个链接，但在尝试访问该链接时没有任何 react
jupyter - 如何共享 Jupyter 笔记本
这个问题在这里已经有了答案: How can I share Jupyter notebooks with non-programmers? [closed] (6 个回答) 5年前关闭。我安装了一
jupyter-notebook - Jupyter 笔记本自动完成显示太多
我试图在 jupyter notebook 中自动完成路径。按“tab”后，它显示的不仅仅是文件夹或文件。我认为这些是python的内置功能。有没有办法在自动完成路径时只显示路径和文件？谢谢! 最佳
jupyter - 从控制台执行 Jupyter notebook
我在 Jupyter notebook 中组合了一些数据分析步骤。随着数据的变化，我希望能够重新运行所有单元格(以考虑新数据) 转换为html以供查看我知道我可以通过 jupyter nbcon
jupyter-notebook - jupyter 实验室中的自动单元格执行计时
在 jupyter 中笔记本 , 我可以用 nbextensions 配置自动单元计时，结果是这样的: 我怎样才能在 jupyter 中做到这一点实验室 ?我没有找到任何做类似事情的扩展。观察:
jupyter-notebook - 无法在受限数据处理设置中安装 JUPYTER
我正在寻找一个带有 Jupter 可选组件的数据处理集群。 gcloud beta dataproc clusters create cluster-1ea3 --enable-component-g
jupyter-notebook - Jupyter 笔记本自动完成显示重复选项
Jupyter Notebook 的自动完成功能似乎有效，但不知何故它会显示该方法的重复选项。例如下面: 对于每个可能的选项，下拉菜单将显示 2 个相同的选项。为什么会发生这种情况以及如何解决？最佳
jupyter-notebook - Jupyter 实验室不断开启简单模式
每当我将 jupyter 实验室窗口推到一边时，“简单模式”就会被激活。这导致只显示一个选项卡，而其他选项卡被隐藏。这非常烦人，我不敢相信这是一个标准功能(只是再次安装了 jupyter 实验室)。
jupyter-notebook - Jupyter Notebook新电池类型默认
当我使用jupyter notebook时，我希望新单元格的类型为“markdown”。默认情况下，新单元格的类型为“代码”。我应该修改哪个配置文件以及应该更改哪个变量？最佳答案转到您的pyt
jupyter - Jupyter 下的 Haskell
奇怪的是，互联网上没有关于如何在 Jupyter 环境下运行 Haskell 的说明。任何引导您实现此目的的文档都需要您从源代码编译，但是当尝试这样做时，会发生各种构建错误。奇怪的是，一个肯定会给
jupyter-notebook - Jupyter 中的非阻塞单元执行
在带有 ipython 内核的 Jupyter 中，是否有以非阻塞方式执行单元格的规范方法？理想情况下，我希望能够运行一个单元格 %%background time.sleep(10) print(

首页

博学

6Ren·AI

商城

apache-spark - Jupyter Notebook 上未显示结构化流输出