如何使用Puppeteer结合代理实现高效网页自动化?
- 内容介绍
- 文章标签
- 相关推荐
本文共计872个文字,预计阅读时间需要4分钟。
背景:使用Puppeteer进行网页访问时,有时需要用到代理。
环境:CentOS 7 + Chrome + 安装Puppeteer并使用Chrome。
参考:使用Chrome的命令行方式。
在官方文档中未找到具体说明,以下为一般执行文件的方法。
背景
在使用puppeteer进行访问页面的时候,有时候需要用到代理。
环境: centos 7
chrome 安装
puppeteer使用chrome。 参考chrome的命令行使用方式。 在官网中没看到说明,不过一般的执行文件都是支持help的。
在服务器上安装chrome :
vim /etc/yum.repos.d/google-chrome.repo
添加内容
[google-chrome] name=google-chrome baseurl=dl.google.com/linux/chrome/rpm/stable/$basearch enabled=1 gpgcheck=1 gpgkey=dl-ssl.google.com/linux/linux_signing_key.pub
安装浏览器
yum -y install google-chrome-stable
说明: yum search chrome 可以查看供安装的包
chrome 命令行代理
在shell中执行命令:
google-chrome -h
即可看到所有的命令选项,其中 OPTION 下面有代理添加的介绍以及示例:
--proxy-server=host:port Specify the HTTP/SOCKS4/SOCKS5 proxy server to use for requests. This overrides any environment variables or settings picked via the options dialog. An individual proxy server is specified using the format: [<proxy-scheme>://]<proxy-host>[:<proxy-port>] Where <proxy-scheme> is the protocol of the proxy server, and is one of: "foobar:1080" Use the SOCKS v5 proxy "foobar:1080" to load all URLs. --proxy-server="socks4://foobar:1080" Use the SOCKS v4 proxy "foobar:1080" to load all URLs. --proxy-server="socks5://foobar:66" Use the SOCKS v5 proxy "foobar:66" to load all URLs. It is also possible to specify a separate proxy server for dif‐ ferent URL types, by prefixing the proxy server specifier with a URL specifier: Example: --proxy-server="baz:1080" Load * URLs using the HTTP proxy "proxy1:80". And load * URLs using the SOCKS v4 proxy "baz:1080". --no-proxy-server Disables the proxy server. Overrides any environment variables or settings picked via the options dialog. --proxy-auto-detect Autodetect proxy configuration. Overrides any environment vari‐ ables or settings picked via the options dialog. --proxy-pac-url=URL Specify proxy autoconfiguration URL. Overrides any environment variables or settings picked via the options dialog.
其中 –proxy-server= 的值的格式是 [<proxy-scheme>://]<proxy-host>[:<proxy-port>]
其中 127.0.0.1:1088" --print-to-pdf www.chromestatus.com/
上面的示例中并没有 需要密码(用户)验证的。
puppeteer 添加代理
在以上命令行中, 代理 option 添加方式是:
--proxy-server="socks5://127.0.0.1:1088"
在 puppeteer 中,启动浏览器时添加代理:
复制代码 代码如下:const browser = await puppeteer.launch({headless:true, args:['--no-sandbox','--proxy-server=socks5://127.0.0.1:1088']});
具体puppeteer使用参考网上实例。
说明
有关使用账户密码credentials 的代理使用:
1 新建代理
可以在本地新建一个不用密码的代理,该代理访问有密码的代理。 然后puppeteer 中使用该无密码代理
2 页面添加代理
具体使用可以参考: github.com/GoogleChrome/puppeteer/blob/master/docs/api.md#pageauthenticatecredentials
自己还没使用过.
参考文章:
chrome 安装 www.jb51.net/article/153596.htm
puppeteer api 说明 github.com/GoogleChrome/puppeteer/blob/master/docs/api.md
代理问题 github.com/GoogleChrome/puppeteer/issues/336
puppeteer 官方文档 pptr.dev/#?product=Puppeteer&version=v1.5.0&show=api-class-page
以上就是本文的全部内容,希望对大家的学习有所帮助,也希望大家多多支持自由互联。
本文共计872个文字,预计阅读时间需要4分钟。
背景:使用Puppeteer进行网页访问时,有时需要用到代理。
环境:CentOS 7 + Chrome + 安装Puppeteer并使用Chrome。
参考:使用Chrome的命令行方式。
在官方文档中未找到具体说明,以下为一般执行文件的方法。
背景
在使用puppeteer进行访问页面的时候,有时候需要用到代理。
环境: centos 7
chrome 安装
puppeteer使用chrome。 参考chrome的命令行使用方式。 在官网中没看到说明,不过一般的执行文件都是支持help的。
在服务器上安装chrome :
vim /etc/yum.repos.d/google-chrome.repo
添加内容
[google-chrome] name=google-chrome baseurl=dl.google.com/linux/chrome/rpm/stable/$basearch enabled=1 gpgcheck=1 gpgkey=dl-ssl.google.com/linux/linux_signing_key.pub
安装浏览器
yum -y install google-chrome-stable
说明: yum search chrome 可以查看供安装的包
chrome 命令行代理
在shell中执行命令:
google-chrome -h
即可看到所有的命令选项,其中 OPTION 下面有代理添加的介绍以及示例:
--proxy-server=host:port Specify the HTTP/SOCKS4/SOCKS5 proxy server to use for requests. This overrides any environment variables or settings picked via the options dialog. An individual proxy server is specified using the format: [<proxy-scheme>://]<proxy-host>[:<proxy-port>] Where <proxy-scheme> is the protocol of the proxy server, and is one of: "foobar:1080" Use the SOCKS v5 proxy "foobar:1080" to load all URLs. --proxy-server="socks4://foobar:1080" Use the SOCKS v4 proxy "foobar:1080" to load all URLs. --proxy-server="socks5://foobar:66" Use the SOCKS v5 proxy "foobar:66" to load all URLs. It is also possible to specify a separate proxy server for dif‐ ferent URL types, by prefixing the proxy server specifier with a URL specifier: Example: --proxy-server="baz:1080" Load * URLs using the HTTP proxy "proxy1:80". And load * URLs using the SOCKS v4 proxy "baz:1080". --no-proxy-server Disables the proxy server. Overrides any environment variables or settings picked via the options dialog. --proxy-auto-detect Autodetect proxy configuration. Overrides any environment vari‐ ables or settings picked via the options dialog. --proxy-pac-url=URL Specify proxy autoconfiguration URL. Overrides any environment variables or settings picked via the options dialog.
其中 –proxy-server= 的值的格式是 [<proxy-scheme>://]<proxy-host>[:<proxy-port>]
其中 127.0.0.1:1088" --print-to-pdf www.chromestatus.com/
上面的示例中并没有 需要密码(用户)验证的。
puppeteer 添加代理
在以上命令行中, 代理 option 添加方式是:
--proxy-server="socks5://127.0.0.1:1088"
在 puppeteer 中,启动浏览器时添加代理:
复制代码 代码如下:const browser = await puppeteer.launch({headless:true, args:['--no-sandbox','--proxy-server=socks5://127.0.0.1:1088']});
具体puppeteer使用参考网上实例。
说明
有关使用账户密码credentials 的代理使用:
1 新建代理
可以在本地新建一个不用密码的代理,该代理访问有密码的代理。 然后puppeteer 中使用该无密码代理
2 页面添加代理
具体使用可以参考: github.com/GoogleChrome/puppeteer/blob/master/docs/api.md#pageauthenticatecredentials
自己还没使用过.
参考文章:
chrome 安装 www.jb51.net/article/153596.htm
puppeteer api 说明 github.com/GoogleChrome/puppeteer/blob/master/docs/api.md
代理问题 github.com/GoogleChrome/puppeteer/issues/336
puppeteer 官方文档 pptr.dev/#?product=Puppeteer&version=v1.5.0&show=api-class-page
以上就是本文的全部内容,希望对大家的学习有所帮助,也希望大家多多支持自由互联。

