python-scripts/09_basic_link_web_crawler.py

import requests
import re
import urlparse

# regex
link_re = re.compile(r'href="(.*?)"')


def crawl(url):

    req = requests.get(url)

    # Check if successful
    if(req.status_code != 200):
        return []

    # Find links
    links = link_re.findall(req.text)

    print "\nFound {} links".format(len(links))

    # Search links for emails
    for link in links:

        # Get an absolute URL for a link
        link = urlparse.urljoin(url, link)

        print link
        

if __name__ == '__main__':
    crawl('http://www.realpython.com')
added link scraper 2014-05-18 16:29:23 +02:00			`import requests`
			`import re`
			`import urlparse`

			`# regex`
			`link_re = re.compile(r'href="(.*?)"')`


updates 2014-05-18 20:16:56 +02:00			`def crawl(url):`
added link scraper 2014-05-18 16:29:23 +02:00
updates 2014-05-18 20:16:56 +02:00			`req = requests.get(url)`
added link scraper 2014-05-18 16:29:23 +02:00
updates 2014-05-18 20:16:56 +02:00			`# Check if successful`
			`if(req.status_code != 200):`
			`return []`
added link scraper 2014-05-18 16:29:23 +02:00
updates 2014-05-18 20:16:56 +02:00			`# Find links`
			`links = link_re.findall(req.text)`
added link scraper 2014-05-18 16:29:23 +02:00
updates 2014-05-18 20:16:56 +02:00			`print "\nFound {} links".format(len(links))`
added link scraper 2014-05-18 16:29:23 +02:00
updates 2014-05-18 20:16:56 +02:00			`# Search links for emails`
			`for link in links:`
added link scraper 2014-05-18 16:29:23 +02:00
updates 2014-05-18 20:16:56 +02:00			`# Get an absolute URL for a link`
			`link = urlparse.urljoin(url, link)`
added link scraper 2014-05-18 16:29:23 +02:00
updates 2014-05-18 20:16:56 +02:00			`print link`
added image optimizer 2014-05-18 23:36:36 +02:00
added link scraper 2014-05-18 16:29:23 +02:00
updates 2014-05-18 20:16:56 +02:00			`if __name__ == '__main__':`
			`crawl('http://www.realpython.com')`
added image optimizer 2014-05-18 23:36:36 +02:00