火花流不起作用

debugcn 发表于 Dev

萨基兰·耶拉姆

我有一个基本的火花流字数统计功能，但它无法正常工作。

import sys
from pyspark import SparkConf, SparkContext
from pyspark.streaming import StreamingContext

sc = SparkContext(appName='streaming', master="local[*]")
scc = StreamingContext(sc, batchDuration=5)

lines = scc.socketTextStream("localhost", 9998)
words = lines.flatMap(lambda line: line.split())
counts = words.map(lambda word: (word, 1)).reduceByKey(lambda x, y: x + y)

counts.pprint()

print 'Listening'
scc.start()
scc.awaitTermination()

我在另一个终端上运行，nc -lk 9998并且粘贴了一些文本。它打印出典型的日志（无例外），但最终使该任务排队了一段时间（45年），并且继续打印此日志...

15/06/19 18:53:30 INFO SparkContext: Created broadcast 1 from broadcast at DAGScheduler.scala:874
15/06/19 18:53:30 INFO DAGScheduler: Submitting 1 missing tasks from ResultStage 2 (PythonRDD[7] at RDD at PythonRDD.scala:43)
15/06/19 18:53:30 INFO TaskSchedulerImpl: Adding task set 2.0 with 1 tasks
15/06/19 18:53:35 INFO JobScheduler: Added jobs for time 1434754415000 ms
15/06/19 18:53:40 INFO JobScheduler: Added jobs for time 1434754420000 ms
15/06/19 18:53:45 INFO JobScheduler: Added jobs for time 1434754425000 ms
...
...

我究竟做错了什么？

霍尔顿

Spark Streaming需要多个执行者才能工作。尝试使用master [4]作为主服务器。

本文收集自互联网，转载请注明来源。

如有侵权，请联系[email protected] 删除。