5 минут, сделай сам туннельный прокси

задняя часть рептилия
5 минут, сделай сам туннельный прокси

Что такое туннельный прокси? Давайте посмотрим на скриншот ниже:

Так называемый туннельный прокси — это служба прокси, которая может автоматически изменить IP-адрес прокси для вас. В вашем коде вам нужно только записать прокси-адрес записи до смерти, а затем инициировать запрос в обычном режиме, а запрос, полученный целевым сервером, каждый раз является другим прокси-адресом.

На прокси-сайте цена 50 одновременных туннельных агентов в секунду составляет 4000 юаней в месяц:

Обычный первый интерфейс запроса, чтобы получить номер IP-адреса прокси, а затем выбрать прокси-сервер, инициировал примитивный запрос, цена составляла 600 юаней в месяц:

Таким образом, мы сэкономили бы много денег, если бы могли сами сделать туннельный прокси!

Принцип туннельного прокси, который отличается от обычного прокси, можно ясно объяснить с помощью следующих двух рисунков:

传统代理服务

隧道代理

Чтобы разработать такой туннельный прокси самостоятельно, нам нужно сделать два шага:

  1. Создайте пул прокси
  2. Реализовать автоматическую переадресацию прокси

Создайте пул прокси

Предположим, адрес дешевого прокси, который вы купили у поставщика прокси:http://xxx.com/ips, запрос непосредственно в браузере, эффект страницы показан ниже:

Теперь все, что вам нужно сделать, это написать программу, которая периодически посещает этот URL-адрес, извлекает последний доступный IP-адрес и помещает его в Redis.

Здесь мы используем структуру данных Hash Redis, где имя поля HashIP:端口, значение внутри представляет собой некоторую информацию, относящуюся к каждому IP.

Ваша программа должна убедиться, что все прокси-адреса, которые в настоящее время находятся в Redis, доступны. Вот пример программы:

"""
ProxyManager.py
~~~~~~~~~~~~~~~~~~~~~
简易代理池管理工具,直接从URL中读取所有
最新的代理,并写入Redis。
"""
import yaml
import time
import json
import redis
import datetime
import requests


class ProxyManager:
    def __init__(self):
        self.config = self.read_config()
        self.redis_config = self.config['redis']
        self.client = redis.Redis(host=self.redis_config['host'],
                                  password=self.redis_config['password'],
                                  port=self.redis_config['port'])
        self.instance_dict = {}

    def read_config(self):
        with open('config.yaml') as f:
            config = yaml.safe_load(f.read())
            return config

    def read_ip(self):
        resp = requests.get(self.config['proxy']).text
        if '{' in resp:
            return []
        proxy_list = resp.split()
        return proxy_list

    def delete_ip(self, live_ips, pool_ips):
        ip_to_removed = set(pool_ips) - set(live_ips)
        if ip_to_removed:
            print('ip to be removed:', ip_to_removed)
            self.client.hdel(self.redis_config['key'], *list(ip_to_removed))

    def add_new_ips(self, live_ips, pool_ips):
        ip_to_add = set(live_ips) - set(pool_ips)
        if ip_to_add:
            print('ip to add:', ip_to_add)
            ips = {}
            for ip in ip_to_add:
                ips[ip] = json.dumps({'private_ip': ip,
                                      'ts': datetime.datetime.now().strftime('%Y-%m-%d %H:%M:%S')})
            self.client.hset(self.redis_config['key'], mapping=ips)

    def run(self):
        while True:
            live_ips = self.read_ip()
            pool_ips = [x.decode() for x in self.client.hgetall(self.redis_config['key'])]
            self.delete_ip(live_ips, pool_ips)
            self.add_new_ips(live_ips, pool_ips)
            time.sleep(40)


if __name__ == '__main__':
    manager = ProxyManager()
    manager.run()

Среди них я записал конфигурацию, связанную с Redis, и URL-адрес прокси-провайдера в файл конфигурации yaml, чтобы вы его не видели. Формат файла конфигурации показан на следующем рисунке:

Поскольку IP предоставляется моим агентом-поставщиком, срок действия составляет 1-5 минут, поэтому IP я меняю каждые 40 секунд. При замене используется инкрементная замена. Сравните IP-адрес текущего извлеченного IP-адреса и Redis. IP-адрес не удаляется из Redis, а затем добавляется новый IP-адрес в Redis.

В реальном процессе вы также можете добавить некоторую логику проверки прокси-сервера, чтобы убедиться, что прокси-сервер, извлеченный из URL-адреса, также проверяется на достоверность, и если он будет признан недействительным, он будет немедленно удален.

Реализовать автоматическую переадресацию

Чтобы добиться автоматической переадресации, мы можем использоватьOpenResty. Это высокопроизводительная веб-платформа на основе Nginx и Lua. Через него мы можем использовать язык Lua для реализации некоторой логики, такой как чтение данных из Redis, перенаправление исходного запроса на вышестоящий прокси-сервер...

Поэтому мы используем OpenResty для создания службы переадресации. И используйте IP-адрес сервера, на котором находится эта служба пересылки, в качестве нашего IP-адреса входа. При использовании запросов и других клиентов сетевых запросов для отправки запросов вам нужно только установить этот IP-адрес записи в качестве прокси. Затем, когда клиент отправляет запрос, запрос сначала отправляется в OpenResty. Затем он случайным образом выбирает IP-адрес прокси-сервера из Redis в качестве вышестоящего прокси-сервера и перенаправляет только что отправленный запрос на вышестоящий прокси-сервер. Чтобы реализовать эффект туннельного прокси.

LUA - очень старый язык, и его синтаксис отличается от питона во многих отношениях. Но не волнуйтесь, я уже написал этот файл конфигурации. Каждый может принять его и изменить его.

Соответствующий файл конфигурации показан на следующем рисунке:

worker_processes  16;        #nginx worker 数量
error_log /usr/local/openresty/nginx/logs/error.log;   #指定错误日志文件路径
events {
    worker_connections 1024;
}


stream {
    ## TCP 代理日志格式定义
    log_format tcp_proxy '$remote_addr [$time_local] '
                         '$protocol $status $bytes_sent $bytes_received '
                         '$session_time "$upstream_addr" '
                         '"$upstream_bytes_sent" "$upstream_bytes_received" "$upstream_connect_time"';
    ## TCP 代理日志配置
    access_log /usr/local/openresty/nginx/logs/access.log tcp_proxy;
    open_log_file_cache off;

    ## TCP 代理配置
    upstream backend{
        server 127.0.0.2:1101;# 爱写啥写啥  反正下面的代码也给你改了
        balancer_by_lua_block {
            -- 初始化balancer
            local balancer = require "ngx.balancer"
            local host = ""
            local port = 0
            host = ngx.ctx.proxy_host
            port = ngx.ctx.proxy_port
            -- 设置 balancer
            local ok, err = balancer.set_current_peer(host, port)
            if not ok then
                ngx.log(ngx.ERR, "failed to set the peer: ", err)
            end
        }
    }


    server {
        preread_by_lua_block{

            local redis = require("resty.redis")
            --创建实例
            local redis_instance = redis:new()
            --设置超时(毫秒)
            redis_instance:set_timeout(3000)
            --建立连接,请在这里配置Redis 的 IP 地址、端口号、密码和用到的 Key
            local rhost = "123.45.67.89"
            local rport = 6739
            local rpass = "abcdefg"
            local rkey = "proxy:pool"
            local ok, err = redis_instance:connect(rhost, rport)
            ngx.log(ngx.ERR, "1111111 ", ok, " ", err)

            -- 如果没有密码,移除下面这一行
            local res, err = redis_instance:auth(rpass)
            local res, err = redis_instance:hkeys(rkey)
            if not res then
                ngx.log(ngx.ERR,"res num error : ", err)
                return redis_instance:close()
            end
            math.randomseed(tostring(ngx.now()):reverse():sub(1, 6))
            local proxy = res[math.random(#res)]
            local colon_index = string.find(proxy, ":")
            local proxy_ip = string.sub(proxy, 1, colon_index - 1)
            local proxy_port = string.sub(proxy, colon_index + 1)
            ngx.log(ngx.ERR,"redis data = ", proxy_ip, ":", proxy_port);
            ngx.ctx.proxy_host = proxy_ip
            ngx.ctx.proxy_port = proxy_port
            redis_instance:close()
        }
        #  下面是本机的端口,也就是爬虫固定写死的端口
       listen 0.0.0.0:9976; #监听本机地址和端口,当使用keeplived的情况下使用keeplived VIP
       proxy_connect_timeout 3s;
       proxy_timeout 10s;
       proxy_pass backend; #这里填写对端的地址
    }
}

Где мне нужно изменить, я уже сделал комментарии в файле конфигурации. В частности, места, которые необходимо изменить, включают:

  • Адрес, порт, пароль и ключ Redis. Если у вашего Redis нет пароля, вы можете удалить строку, устанавливающую пароль

  • Входной прокси-порт

После установки этих конфигураций мы можем использовать Docker для его запуска. Конфигурационный файл Docker чрезвычайно прост:

from openresty/openresty:centos

copy nginx_redis.conf /usr/local/openresty/nginx/conf/nginx.conf

Затем выполните сборку команды и запустите:

docker build --network host -t tunnel_proxy:0.01 .
docker run --name tunnel_proxy --network host -it tunnel_proxy:0.01

После запуска вы увидите, что командная строка Docker кажется зависшей. Это нормальный запрос. Поскольку для этого требуется, чтобы у вас был запрос, он выведет содержимое.

Теперь вы можете использовать запросы, чтобы быстро написать фрагмент кода для проверки:

import requests
import time

proxies = {'http': 'http://13.88.220.207:9976'}
for _ in range(10):
    resp = requests.get('http://httpbin.org/ip', proxies=proxies).text
    print(resp)
    time.sleep(1)

Эффект операции показан на рисунке ниже.

Это означает, что туннельный прокси успешно установлен. На данный момент у меня уже пол года стабильно работает туннельный прокси, проблем ни разу не было, можно смело пользоваться.

Наконец, на эту статью повлияла статья @ Mengmu Gai:Создание прокси-сервера Openresty для переадресации - Ищу программистаВдохновлено и улучшено на основе этой статьи. Автору оригинала отдельное спасибо.