python-scripts/08_basic_email_web_crawler.py

import requests
import re
try:
    from urllib.parse import urljoin
except ImportError:
    from urlparse import urljoin

# regex
email_re = re.compile(r'([\w\.,]+@[\w\.,]+\.\w+)')
link_re = re.compile(r'href="(.*?)"')


def crawl(url):

    result = set()

    req = requests.get(url)

    # Check if successful
    if(req.status_code != 200):
        return []

    # Find links
    links = link_re.findall(req.text)

    print("\nFound {} links".format(len(links)))

    # Search links for emails
    for link in links:

        # Get an absolute URL for a link
        link = urljoin(url, link)

        # Find all emails on current page
        result.update(email_re.findall(req.text))

    return result

if __name__ == '__main__':
    emails = crawl('http://www.realpython.com')

    print("\nScrapped e-mail addresses:")
    for email in emails:
        print(email)
    print("\n")
added web crawler 2014-05-14 02:48:46 +02:00			`import requests`
			`import re`
added stock scraper, converted all scripts to python 2/3 compatibility 2015-05-17 11:49:35 +02:00			`try:`
			`from urllib.parse import urljoin`
			`except ImportError:`
			`from urlparse import urljoin`
added web crawler 2014-05-14 02:48:46 +02:00
			`# regex`
			`email_re = re.compile(r'([\w\.,]+@[\w\.,]+\.\w+)')`
			`link_re = re.compile(r'href="(.*?)"')`

added link scraper 2014-05-18 16:29:23 +02:00
updates 2014-05-18 20:16:56 +02:00			`def crawl(url):`
added web crawler 2014-05-14 02:48:46 +02:00
			`result = set()`

updates 2014-05-18 20:16:56 +02:00			`req = requests.get(url)`
added web crawler 2014-05-14 02:48:46 +02:00
updates 2014-05-18 20:16:56 +02:00			`# Check if successful`
			`if(req.status_code != 200):`
			`return []`
added web crawler 2014-05-14 02:48:46 +02:00
updates 2014-05-18 20:16:56 +02:00			`# Find links`
			`links = link_re.findall(req.text)`
added web crawler 2014-05-14 02:48:46 +02:00
added stock scraper, converted all scripts to python 2/3 compatibility 2015-05-17 11:49:35 +02:00			`print("\nFound {} links".format(len(links)))`
added web crawler 2014-05-14 02:48:46 +02:00
updates 2014-05-18 20:16:56 +02:00			`# Search links for emails`
			`for link in links:`
added web crawler 2014-05-14 02:48:46 +02:00
updates 2014-05-18 20:16:56 +02:00			`# Get an absolute URL for a link`
added stock scraper, converted all scripts to python 2/3 compatibility 2015-05-17 11:49:35 +02:00			`link = urljoin(url, link)`
added web crawler 2014-05-14 02:48:46 +02:00
updates 2014-05-18 20:16:56 +02:00			`# Find all emails on current page`
			`result.update(email_re.findall(req.text))`
added web crawler 2014-05-14 02:48:46 +02:00
			`return result`

updates 2014-05-18 20:16:56 +02:00			`if __name__ == '__main__':`
			`emails = crawl('http://www.realpython.com')`
added web crawler 2014-05-14 02:48:46 +02:00
added stock scraper, converted all scripts to python 2/3 compatibility 2015-05-17 11:49:35 +02:00			`print("\nScrapped e-mail addresses:")`
updates 2014-05-18 20:16:56 +02:00			`for email in emails:`
added stock scraper, converted all scripts to python 2/3 compatibility 2015-05-17 11:49:35 +02:00			`print(email)`
			`print("\n")`