commit ab436a8918403b167077dabd319317f42f3af46a Author: c-my Date: Mon Sep 27 20:10:03 2021 +0800 Initial commit diff --git a/.gitignore b/.gitignore new file mode 100644 index 0000000..8a0a60d --- /dev/null +++ b/.gitignore @@ -0,0 +1,4 @@ +# Project exclude paths +/.gradle/ +/build/ +/build/classes/java/main/ \ No newline at end of file diff --git a/.idea/.gitignore b/.idea/.gitignore new file mode 100644 index 0000000..73f69e0 --- /dev/null +++ b/.idea/.gitignore @@ -0,0 +1,8 @@ +# Default ignored files +/shelf/ +/workspace.xml +# Datasource local storage ignored files +/dataSources/ +/dataSources.local.xml +# Editor-based HTTP Client requests +/httpRequests/ diff --git a/.idea/compiler.xml b/.idea/compiler.xml new file mode 100644 index 0000000..b589d56 --- /dev/null +++ b/.idea/compiler.xml @@ -0,0 +1,6 @@ + + + + + + \ No newline at end of file diff --git a/.idea/encodings.xml b/.idea/encodings.xml new file mode 100644 index 0000000..c2bae49 --- /dev/null +++ b/.idea/encodings.xml @@ -0,0 +1,6 @@ + + + + + + \ No newline at end of file diff --git a/.idea/gradle.xml b/.idea/gradle.xml new file mode 100644 index 0000000..1b6b8cb --- /dev/null +++ b/.idea/gradle.xml @@ -0,0 +1,20 @@ + + + + + + + \ No newline at end of file diff --git a/.idea/jarRepositories.xml b/.idea/jarRepositories.xml new file mode 100644 index 0000000..2db8201 --- /dev/null +++ b/.idea/jarRepositories.xml @@ -0,0 +1,35 @@ + + + + + + + + + + + + + + + + + \ No newline at end of file diff --git a/.idea/misc.xml b/.idea/misc.xml new file mode 100644 index 0000000..fe0b0da --- /dev/null +++ b/.idea/misc.xml @@ -0,0 +1,10 @@ + + + + + + + + + + \ No newline at end of file diff --git a/.idea/runConfigurations.xml b/.idea/runConfigurations.xml new file mode 100644 index 0000000..797acea --- /dev/null +++ b/.idea/runConfigurations.xml @@ -0,0 +1,10 @@ + + + + + + \ No newline at end of file diff --git a/build.gradle b/build.gradle new file mode 100644 index 0000000..9fb8115 --- /dev/null +++ b/build.gradle @@ -0,0 +1,36 @@ +plugins { + id 'java' + id 'org.beryx.jlink' version '2.24.2' +} + +group 'cmy' +version '1.0.0' + +repositories { + mavenCentral() +} + +dependencies { + testImplementation 'org.junit.jupiter:junit-jupiter-api:5.7.0' + testRuntimeOnly 'org.junit.jupiter:junit-jupiter-engine:5.7.0' + implementation group: 'org.jsoup', name: 'jsoup', version: '1.14.2' +} + +test { + useJUnitPlatform() +} + +application { + mainModule = 'cmy.newsspider' + mainClass = 'cmy.newsspider.Main' +} +allprojects { + repositories { + maven { url 'https://maven.aliyun.com/repository/public/' } + mavenLocal() + mavenCentral() + } +} +tasks.withType(JavaCompile) { + options.encoding = "UTF-8" +} diff --git a/gradle/wrapper/gradle-wrapper.jar b/gradle/wrapper/gradle-wrapper.jar new file mode 100644 index 0000000..7454180 Binary files /dev/null and b/gradle/wrapper/gradle-wrapper.jar differ diff --git a/gradle/wrapper/gradle-wrapper.properties b/gradle/wrapper/gradle-wrapper.properties new file mode 100644 index 0000000..ffed3a2 --- /dev/null +++ b/gradle/wrapper/gradle-wrapper.properties @@ -0,0 +1,5 @@ +distributionBase=GRADLE_USER_HOME +distributionPath=wrapper/dists +distributionUrl=https\://services.gradle.org/distributions/gradle-7.2-bin.zip +zipStoreBase=GRADLE_USER_HOME +zipStorePath=wrapper/dists diff --git a/gradlew b/gradlew new file mode 100644 index 0000000..3da45c1 --- /dev/null +++ b/gradlew @@ -0,0 +1,234 @@ +#!/bin/sh + +# +# Copyright ? 2015-2021 the original authors. +# +# Licensed under the Apache License, Version 2.0 (the "License"); +# you may not use this file except in compliance with the License. +# You may obtain a copy of the License at +# +# https://www.apache.org/licenses/LICENSE-2.0 +# +# Unless required by applicable law or agreed to in writing, software +# distributed under the License is distributed on an "AS IS" BASIS, +# WITHOUT WARRANTIES OR CONDITIONS OF ANY KIND, either express or implied. +# See the License for the specific language governing permissions and +# limitations under the License. +# + +############################################################################## +# +# Gradle start up script for POSIX generated by Gradle. +# +# Important for running: +# +# (1) You need a POSIX-compliant shell to run this script. If your /bin/sh is +# noncompliant, but you have some other compliant shell such as ksh or +# bash, then to run this script, type that shell name before the whole +# command line, like: +# +# ksh Gradle +# +# Busybox and similar reduced shells will NOT work, because this script +# requires all of these POSIX shell features: +# * functions; +# * expansions ?$var?, ?${var}?, ?${var:-default}?, ?${var+SET}?, +# ?${var#prefix}?, ?${var%suffix}?, and ?$( cmd )?; +# * compound commands having a testable exit status, especially ?case?; +# * various built-in commands including ?command?, ?set?, and ?ulimit?. +# +# Important for patching: +# +# (2) This script targets any POSIX shell, so it avoids extensions provided +# by Bash, Ksh, etc; in particular arrays are avoided. +# +# The "traditional" practice of packing multiple parameters into a +# space-separated string is a well documented source of bugs and security +# problems, so this is (mostly) avoided, by progressively accumulating +# options in "$@", and eventually passing that to Java. +# +# Where the inherited environment variables (DEFAULT_JVM_OPTS, JAVA_OPTS, +# and GRADLE_OPTS) rely on word-splitting, this is performed explicitly; +# see the in-line comments for details. +# +# There are tweaks for specific operating systems such as AIX, CygWin, +# Darwin, MinGW, and NonStop. +# +# (3) This script is generated from the Groovy template +# https://github.com/gradle/gradle/blob/master/subprojects/plugins/src/main/resources/org/gradle/api/internal/plugins/unixStartScript.txt +# within the Gradle project. +# +# You can find Gradle at https://github.com/gradle/gradle/. +# +############################################################################## + +# Attempt to set APP_HOME + +# Resolve links: $0 may be a link +app_path=$0 + +# Need this for daisy-chained symlinks. +while + APP_HOME=${app_path%"${app_path##*/}"} # leaves a trailing /; empty if no leading path + [ -h "$app_path" ] +do + ls=$( ls -ld "$app_path" ) + link=${ls#*' -> '} + case $link in #( + /*) app_path=$link ;; #( + *) app_path=$APP_HOME$link ;; + esac +done + +APP_HOME=$( cd "${APP_HOME:-./}" && pwd -P ) || exit + +APP_NAME="Gradle" +APP_BASE_NAME=${0##*/} + +# Add default JVM options here. You can also use JAVA_OPTS and GRADLE_OPTS to pass JVM options to this script. +DEFAULT_JVM_OPTS='"-Xmx64m" "-Xms64m"' + +# Use the maximum available, or set MAX_FD != -1 to use that value. +MAX_FD=maximum + +warn () { + echo "$*" +} >&2 + +die () { + echo + echo "$*" + echo + exit 1 +} >&2 + +# OS specific support (must be 'true' or 'false'). +cygwin=false +msys=false +darwin=false +nonstop=false +case "$( uname )" in #( + CYGWIN* ) cygwin=true ;; #( + Darwin* ) darwin=true ;; #( + MSYS* | MINGW* ) msys=true ;; #( + NONSTOP* ) nonstop=true ;; +esac + +CLASSPATH=$APP_HOME/gradle/wrapper/gradle-wrapper.jar + + +# Determine the Java command to use to start the JVM. +if [ -n "$JAVA_HOME" ] ; then + if [ -x "$JAVA_HOME/jre/sh/java" ] ; then + # IBM's JDK on AIX uses strange locations for the executables + JAVACMD=$JAVA_HOME/jre/sh/java + else + JAVACMD=$JAVA_HOME/bin/java + fi + if [ ! -x "$JAVACMD" ] ; then + die "ERROR: JAVA_HOME is set to an invalid directory: $JAVA_HOME + +Please set the JAVA_HOME variable in your environment to match the +location of your Java installation." + fi +else + JAVACMD=java + which java >/dev/null 2>&1 || die "ERROR: JAVA_HOME is not set and no 'java' command could be found in your PATH. + +Please set the JAVA_HOME variable in your environment to match the +location of your Java installation." +fi + +# Increase the maximum file descriptors if we can. +if ! "$cygwin" && ! "$darwin" && ! "$nonstop" ; then + case $MAX_FD in #( + max*) + MAX_FD=$( ulimit -H -n ) || + warn "Could not query maximum file descriptor limit" + esac + case $MAX_FD in #( + '' | soft) :;; #( + *) + ulimit -n "$MAX_FD" || + warn "Could not set maximum file descriptor limit to $MAX_FD" + esac +fi + +# Collect all arguments for the java command, stacking in reverse order: +# * args from the command line +# * the main class name +# * -classpath +# * -D...appname settings +# * --module-path (only if needed) +# * DEFAULT_JVM_OPTS, JAVA_OPTS, and GRADLE_OPTS environment variables. + +# For Cygwin or MSYS, switch paths to Windows format before running java +if "$cygwin" || "$msys" ; then + APP_HOME=$( cygpath --path --mixed "$APP_HOME" ) + CLASSPATH=$( cygpath --path --mixed "$CLASSPATH" ) + + JAVACMD=$( cygpath --unix "$JAVACMD" ) + + # Now convert the arguments - kludge to limit ourselves to /bin/sh + for arg do + if + case $arg in #( + -*) false ;; # don't mess with options #( + /?*) t=${arg#/} t=/${t%%/*} # looks like a POSIX filepath + [ -e "$t" ] ;; #( + *) false ;; + esac + then + arg=$( cygpath --path --ignore --mixed "$arg" ) + fi + # Roll the args list around exactly as many times as the number of + # args, so each arg winds up back in the position where it started, but + # possibly modified. + # + # NB: a `for` loop captures its iteration list before it begins, so + # changing the positional parameters here affects neither the number of + # iterations, nor the values presented in `arg`. + shift # remove old arg + set -- "$@" "$arg" # push replacement arg + done +fi + +# Collect all arguments for the java command; +# * $DEFAULT_JVM_OPTS, $JAVA_OPTS, and $GRADLE_OPTS can contain fragments of +# shell script including quotes and variable substitutions, so put them in +# double quotes to make sure that they get re-expanded; and +# * put everything else in single quotes, so that it's not re-expanded. + +set -- \ + "-Dorg.gradle.appname=$APP_BASE_NAME" \ + -classpath "$CLASSPATH" \ + org.gradle.wrapper.GradleWrapperMain \ + "$@" + +# Use "xargs" to parse quoted args. +# +# With -n1 it outputs one arg per line, with the quotes and backslashes removed. +# +# In Bash we could simply go: +# +# readarray ARGS < <( xargs -n1 <<<"$var" ) && +# set -- "${ARGS[@]}" "$@" +# +# but POSIX shell has neither arrays nor command substitution, so instead we +# post-process each arg (as a line of input to sed) to backslash-escape any +# character that might be a shell metacharacter, then use eval to reverse +# that process (while maintaining the separation between arguments), and wrap +# the whole thing up as a single "set" statement. +# +# This will of course break if any of these variables contains a newline or +# an unmatched quote. +# + +eval "set -- $( + printf '%s\n' "$DEFAULT_JVM_OPTS $JAVA_OPTS $GRADLE_OPTS" | + xargs -n1 | + sed ' s~[^-[:alnum:]+,./:=@_]~\\&~g; ' | + tr '\n' ' ' + )" '"$@"' + +exec "$JAVACMD" "$@" diff --git a/gradlew.bat b/gradlew.bat new file mode 100644 index 0000000..107acd3 --- /dev/null +++ b/gradlew.bat @@ -0,0 +1,89 @@ +@rem +@rem Copyright 2015 the original author or authors. +@rem +@rem Licensed under the Apache License, Version 2.0 (the "License"); +@rem you may not use this file except in compliance with the License. +@rem You may obtain a copy of the License at +@rem +@rem https://www.apache.org/licenses/LICENSE-2.0 +@rem +@rem Unless required by applicable law or agreed to in writing, software +@rem distributed under the License is distributed on an "AS IS" BASIS, +@rem WITHOUT WARRANTIES OR CONDITIONS OF ANY KIND, either express or implied. +@rem See the License for the specific language governing permissions and +@rem limitations under the License. +@rem + +@if "%DEBUG%" == "" @echo off +@rem ########################################################################## +@rem +@rem Gradle startup script for Windows +@rem +@rem ########################################################################## + +@rem Set local scope for the variables with windows NT shell +if "%OS%"=="Windows_NT" setlocal + +set DIRNAME=%~dp0 +if "%DIRNAME%" == "" set DIRNAME=. +set APP_BASE_NAME=%~n0 +set APP_HOME=%DIRNAME% + +@rem Resolve any "." and ".." in APP_HOME to make it shorter. +for %%i in ("%APP_HOME%") do set APP_HOME=%%~fi + +@rem Add default JVM options here. You can also use JAVA_OPTS and GRADLE_OPTS to pass JVM options to this script. +set DEFAULT_JVM_OPTS="-Xmx64m" "-Xms64m" + +@rem Find java.exe +if defined JAVA_HOME goto findJavaFromJavaHome + +set JAVA_EXE=java.exe +%JAVA_EXE% -version >NUL 2>&1 +if "%ERRORLEVEL%" == "0" goto execute + +echo. +echo ERROR: JAVA_HOME is not set and no 'java' command could be found in your PATH. +echo. +echo Please set the JAVA_HOME variable in your environment to match the +echo location of your Java installation. + +goto fail + +:findJavaFromJavaHome +set JAVA_HOME=%JAVA_HOME:"=% +set JAVA_EXE=%JAVA_HOME%/bin/java.exe + +if exist "%JAVA_EXE%" goto execute + +echo. +echo ERROR: JAVA_HOME is set to an invalid directory: %JAVA_HOME% +echo. +echo Please set the JAVA_HOME variable in your environment to match the +echo location of your Java installation. + +goto fail + +:execute +@rem Setup the command line + +set CLASSPATH=%APP_HOME%\gradle\wrapper\gradle-wrapper.jar + + +@rem Execute Gradle +"%JAVA_EXE%" %DEFAULT_JVM_OPTS% %JAVA_OPTS% %GRADLE_OPTS% "-Dorg.gradle.appname=%APP_BASE_NAME%" -classpath "%CLASSPATH%" org.gradle.wrapper.GradleWrapperMain %* + +:end +@rem End local scope for the variables with windows NT shell +if "%ERRORLEVEL%"=="0" goto mainEnd + +:fail +rem Set variable GRADLE_EXIT_CONSOLE if you need the _script_ return code instead of +rem the _cmd.exe /c_ return code! +if not "" == "%GRADLE_EXIT_CONSOLE%" exit 1 +exit /b 1 + +:mainEnd +if "%OS%"=="Windows_NT" endlocal + +:omega diff --git a/settings.gradle b/settings.gradle new file mode 100644 index 0000000..ac459b8 --- /dev/null +++ b/settings.gradle @@ -0,0 +1,2 @@ +rootProject.name = 'NewsSpider' + diff --git a/src/main/java/cmy/newsspider/Main.java b/src/main/java/cmy/newsspider/Main.java new file mode 100644 index 0000000..079be75 --- /dev/null +++ b/src/main/java/cmy/newsspider/Main.java @@ -0,0 +1,14 @@ +package cmy.newsspider; + +import cmy.newsspider.searchpageextractor.SearchPageExtractor; +import cmy.newsspider.searchpageextractor.SogouSearchPageExtractor; + +public class Main { + public static void main(String[] args) { + + + SearchPageExtractor spe = new SogouSearchPageExtractor(); + var result = spe.searchByKeyword("限电", 20); + System.out.println(result); + } +} diff --git a/src/main/java/cmy/newsspider/pageextractor/ChinanewsExtractor.java b/src/main/java/cmy/newsspider/pageextractor/ChinanewsExtractor.java new file mode 100644 index 0000000..63f3d6b --- /dev/null +++ b/src/main/java/cmy/newsspider/pageextractor/ChinanewsExtractor.java @@ -0,0 +1,68 @@ +package cmy.newsspider.pageextractor; + +import cmy.newsspider.record.NewsRecord; +import org.jsoup.Jsoup; +import org.jsoup.nodes.Document; + +import java.io.IOException; + +public class ChinanewsExtractor extends PageExtractor { + + public ChinanewsExtractor(String url) { + super(url); + } + + + @Override + public String getTitle() { + if (pageDoc == null) return ""; + var titleElement = pageDoc.select("div.content>h1"); + if (titleElement.isEmpty()) { + return ""; + } + return titleElement.text().strip(); + } + + @Override + public String getSource() { + if (pageDoc == null) return ""; + var sourceElement = pageDoc.select("div.content>div.left-time>div.left-t"); + if (sourceElement.isEmpty()) { + return ""; + } + var eachText = sourceElement.get(0).children().eachText(); + var leftText = sourceElement.get(0).textNodes().get(0).getWholeText(); + + //去除最后一个互动标签 + var source = String.join("", eachText.subList(0, eachText.size() - 1)); + var prefix = ""; + var splitList = leftText.split("来源:"); + if (splitList.length > 1) { + prefix = splitList[1]; + } + return prefix + source.strip(); + } + + @Override + public String getDate() { + if (pageDoc == null) return ""; + var dateElement = pageDoc.select("div.content>div.left-time>div.left-t"); + if (dateElement.isEmpty()) { + return ""; + } + var leftText = dateElement.get(0).textNodes().get(0).getWholeText(); + + return leftText.split("来源")[0].strip(); + } + + @Override + public String getContent() { + if (pageDoc == null) return ""; + var contentElement = pageDoc.select("div.content>div.left_zw"); + if (contentElement.isEmpty()) { + return ""; + } + return contentElement.text(); + } + +} diff --git a/src/main/java/cmy/newsspider/pageextractor/HuanqiuExtractor.java b/src/main/java/cmy/newsspider/pageextractor/HuanqiuExtractor.java new file mode 100644 index 0000000..1c24f78 --- /dev/null +++ b/src/main/java/cmy/newsspider/pageextractor/HuanqiuExtractor.java @@ -0,0 +1,35 @@ +package cmy.newsspider.pageextractor; + +public class HuanqiuExtractor extends PageExtractor { + public HuanqiuExtractor(String url) { + super(url); + } + + @Override + public String getTitle() { + if (pageDoc == null) return ""; + var titleElement = pageDoc.select("div.t-container-title>h3"); + return titleElement.text(); + } + + @Override + public String getSource() { + if (pageDoc == null) return ""; + var sourceElement = pageDoc.select("div.metadata-info span.source"); + return sourceElement.text(); + } + + @Override + public String getDate() { + if (pageDoc == null) return ""; + var dateElement = pageDoc.select("div.metadata-info p.time"); + return dateElement.text(); + } + + @Override + public String getContent() { + if (pageDoc == null) return ""; + var contentElement = pageDoc.select("div.b-container div.l-con"); + return contentElement.text(); + } +} diff --git a/src/main/java/cmy/newsspider/pageextractor/IFengExtractor.java b/src/main/java/cmy/newsspider/pageextractor/IFengExtractor.java new file mode 100644 index 0000000..2126ced --- /dev/null +++ b/src/main/java/cmy/newsspider/pageextractor/IFengExtractor.java @@ -0,0 +1,56 @@ +package cmy.newsspider.pageextractor; + +import cmy.newsspider.record.NewsRecord; +import org.jsoup.Jsoup; +import org.jsoup.nodes.Document; + +import java.io.IOException; + +public class IFengExtractor extends PageExtractor { + + public IFengExtractor(String url) { + super(url); + } + + + @Override + public String getTitle() { + if (pageDoc == null) return ""; + var titleElement = pageDoc.select("div[class^=artical] h1[class^=topic-]"); + if (titleElement.isEmpty()) { + titleElement = pageDoc.select("#artical_topic"); + } + return titleElement.text().strip(); + } + + @Override + public String getSource() { + if (pageDoc == null) return ""; + var sourceElement = pageDoc.select("div[class^=artical] div[class^=info-] p[class^=time]>span[class^=publisher]"); + if (sourceElement.isEmpty()) { + sourceElement = pageDoc.select("span[itemprop=publisher]"); + } + return sourceElement.text().strip(); + } + + @Override + public String getDate() { + if (pageDoc == null) return ""; + var dateElement = pageDoc.select("div[class^=artical] div[class^=info-] p[class^=time]>span"); + if (dateElement.isEmpty()) { + dateElement = pageDoc.select("span[itemprop=datePublished]"); + } + return dateElement.get(0).text().strip(); + } + + @Override + public String getContent() { + if (pageDoc == null) return ""; + var contentElement = pageDoc.select("div[class^=artical] div[class^=main_content-]"); + if (contentElement.isEmpty()) { + contentElement = pageDoc.select("div #artical_real"); + } + return contentElement.text(); + } + +} diff --git a/src/main/java/cmy/newsspider/pageextractor/NeteaseExtractor.java b/src/main/java/cmy/newsspider/pageextractor/NeteaseExtractor.java new file mode 100644 index 0000000..85e8fe4 --- /dev/null +++ b/src/main/java/cmy/newsspider/pageextractor/NeteaseExtractor.java @@ -0,0 +1,47 @@ +package cmy.newsspider.pageextractor; + +import cmy.newsspider.record.NewsRecord; +import org.jsoup.Jsoup; +import org.jsoup.nodes.Document; + +import java.io.IOException; + +public class NeteaseExtractor extends PageExtractor { + + public NeteaseExtractor(String url) { + super(url); + } + + @Override + public String getTitle() { + if (pageDoc == null) return ""; + var titleElement = pageDoc.select("h1.post_title"); + return titleElement.text(); + } + + @Override + public String getSource() { + if (pageDoc == null) return ""; + var sourceElement = pageDoc.select("div.post_info"); + try { + return sourceElement.text().split("来源")[1]; + } catch (Exception e) { + System.out.println(sourceElement); + return ""; + } + } + + @Override + public String getDate() { + if (pageDoc == null) return ""; + var sourceElement = pageDoc.select("div.post_info"); + return sourceElement.text().split("来源")[0]; + } + + @Override + public String getContent() { + if (pageDoc == null) return ""; + var contentElement = pageDoc.select("div.post_content>div.post_body"); + return contentElement.text(); + } +} diff --git a/src/main/java/cmy/newsspider/pageextractor/PageExtractor.java b/src/main/java/cmy/newsspider/pageextractor/PageExtractor.java new file mode 100644 index 0000000..cb789f0 --- /dev/null +++ b/src/main/java/cmy/newsspider/pageextractor/PageExtractor.java @@ -0,0 +1,86 @@ +package cmy.newsspider.pageextractor; + +import cmy.newsspider.record.NewsRecord; +import org.jsoup.Jsoup; +import org.jsoup.nodes.Document; + +import java.io.IOException; +import java.util.concurrent.Callable; +import java.util.regex.Pattern; + +public abstract class PageExtractor implements Callable { + // sohu: http://www.sohu.com/a/492356464_121110808 + // netease: https://www.163.com/dy/article/GKTDREEB0548OUH9.html + // netease: http://dy.163.com/article/GK5SJVEL05529M2G.html + // tecent: https://new.qq.com/omn/20210927/20210927A05QTU00.html + // ifeng: https://news.ifeng.com/c/89sSRm9IoyG + // chinanews: http://www.chinanews.com/gn/2021/09-27/9574765.shtml + // youth: http://news.youth.cn/jsxw/202109/t20210916_13222690.htm + // xinhua: http://www.news.cn/mil/2021-09/16/c_1211371426.htm + // huanqer: https://world.huanqiu.com/article/44j5MGsP4Cv + // zhonghua: https://news.china.com/domestic/945/20210809/39853554.html + + + static public PageExtractor getExtractor(String itemUrl) { + var r = Pattern.compile("://(.*?)/"); + var matcher = r.matcher(itemUrl); + if (!matcher.find()) { + return null; + } + return switch (matcher.group(1)) { + case "www.sohu.com" -> new SohuExtractor(itemUrl); + case "www.163.com", "dy.163.com", "news.163.com" -> new NeteaseExtractor(itemUrl); + case "new.qq.com" -> new TecentExtractor(itemUrl); + case "news.ifeng.com", "i.ifeng.com", "mil.ifeng.com" -> new IFengExtractor(itemUrl); + case "www.chinanews.com" -> new ChinanewsExtractor(itemUrl); + case "news.youth.cn" -> new YouthExtractor(itemUrl); + case "www.news.cn", "xinhuanet.com", "www.xinhuanet.com" -> new XinhuaExtractor(itemUrl); + case "world.huanqiu.com", "mil.huanqiu.com", "china.huanqiu.com" -> new HuanqiuExtractor(itemUrl); + case "news.china.com" -> new ZhonghuaExtractor(itemUrl); + default -> null; + }; + } + + protected Document pageDoc; + + public PageExtractor(String url) { + try { + this.pageDoc = Jsoup.connect(url) + .userAgent("Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/94.0.4606.61 Safari/537.36") + .timeout(3000) + .get(); + + } catch (IOException exception) { + this.pageDoc = null; + } + } + + public NewsRecord getNewsRecord() throws IOException { + if (this.pageDoc == null) { + return null; + } + var title = getTitle(); + var content = getContent(); + var source = getSource(); + var date = getDate(); + if (title.equals("") && content.equals("") && source.equals("") && date.equals("")) { + System.out.println(this.pageDoc.location()); + return null; + } + return new NewsRecord(title, content, source, date); + } + + @Override + public NewsRecord call() throws Exception { + return getNewsRecord(); + } + + public abstract String getTitle(); + + public abstract String getSource(); + + public abstract String getDate(); + + public abstract String getContent(); + +} diff --git a/src/main/java/cmy/newsspider/pageextractor/SinaExtractor.java b/src/main/java/cmy/newsspider/pageextractor/SinaExtractor.java new file mode 100644 index 0000000..3dbc22a --- /dev/null +++ b/src/main/java/cmy/newsspider/pageextractor/SinaExtractor.java @@ -0,0 +1,43 @@ +package cmy.newsspider.pageextractor; + +import cmy.newsspider.record.NewsRecord; +import org.jsoup.Jsoup; +import org.jsoup.nodes.Document; + +import java.io.IOException; + +public class SinaExtractor extends PageExtractor { + + public SinaExtractor(String url) { + super(url); + } + + @Override + public String getTitle() { + if (pageDoc == null) return ""; + var titleElement = pageDoc.select("h1.main-title"); + return titleElement.text(); + } + + @Override + public String getSource() { + if (pageDoc == null) return ""; + var sourceElement = pageDoc.select("div.date-source a.source"); + return sourceElement.text(); + } + + @Override + public String getDate() { + if (pageDoc == null) return ""; + var dateElement = pageDoc.select("div.date-source span.date"); + return dateElement.text(); + } + + @Override + public String getContent() { + if (pageDoc == null) return ""; + var contentElement = pageDoc.select("#article"); + return contentElement.text(); + } + +} diff --git a/src/main/java/cmy/newsspider/pageextractor/SohuExtractor.java b/src/main/java/cmy/newsspider/pageextractor/SohuExtractor.java new file mode 100644 index 0000000..03f6f37 --- /dev/null +++ b/src/main/java/cmy/newsspider/pageextractor/SohuExtractor.java @@ -0,0 +1,53 @@ +package cmy.newsspider.pageextractor; + +import cmy.newsspider.record.NewsRecord; +import org.jsoup.Jsoup; +import org.jsoup.nodes.Document; + +import java.io.IOException; + +public class SohuExtractor extends PageExtractor { + + public SohuExtractor(String url) { + super(url); + } + + + @Override + public String getTitle() { + if (pageDoc == null) return ""; + var titleElement = pageDoc.select("div.text-title h1"); + if (titleElement.isEmpty()) { + titleElement = pageDoc.select("h3.article-title"); + } + return titleElement.text(); + } + + @Override + public String getSource() { + if (pageDoc == null) return ""; + var sourceElement = pageDoc.select("div.article-info span[data-role='original-link']"); + return sourceElement.text(); + } + + @Override + public String getDate() { + if (pageDoc == null) return ""; + var dateElement = pageDoc.select("div.article-info span.time"); + if (dateElement.isEmpty()) { + dateElement = pageDoc.select("p.article-info span.time"); + + } + return dateElement.text(); + } + + @Override + public String getContent() { + if (pageDoc == null) return ""; + var contentElement = pageDoc.select("article.article"); + if (contentElement.isEmpty()) { + contentElement = pageDoc.select("article.article-text"); + } + return contentElement.text(); + } +} diff --git a/src/main/java/cmy/newsspider/pageextractor/TecentExtractor.java b/src/main/java/cmy/newsspider/pageextractor/TecentExtractor.java new file mode 100644 index 0000000..6aa9e5a --- /dev/null +++ b/src/main/java/cmy/newsspider/pageextractor/TecentExtractor.java @@ -0,0 +1,39 @@ +package cmy.newsspider.pageextractor; + +import cmy.newsspider.record.NewsRecord; +import org.jsoup.Jsoup; +import org.jsoup.nodes.Document; + +import java.io.IOException; + +public class TecentExtractor extends PageExtractor { + + public TecentExtractor(String url) { + super(url); + } + + + @Override + public String getTitle() { + if (pageDoc == null) return ""; + var titleElement = pageDoc.select("div.LEFT h1"); + return titleElement.text(); + } + + @Override + public String getSource() { + return ""; + } + + @Override + public String getDate() { + return ""; + } + + @Override + public String getContent() { + if (pageDoc == null) return ""; + var contentElement = pageDoc.select("div.content-article"); + return contentElement.text(); + } +} diff --git a/src/main/java/cmy/newsspider/pageextractor/XinhuaExtractor.java b/src/main/java/cmy/newsspider/pageextractor/XinhuaExtractor.java new file mode 100644 index 0000000..c11cf90 --- /dev/null +++ b/src/main/java/cmy/newsspider/pageextractor/XinhuaExtractor.java @@ -0,0 +1,35 @@ +package cmy.newsspider.pageextractor; + +public class XinhuaExtractor extends PageExtractor { + public XinhuaExtractor(String url) { + super(url); + } + + @Override + public String getTitle() { + if (pageDoc == null) return ""; + var titleElement = pageDoc.select("div.head-line span.title"); + return titleElement.text(); + } + + @Override + public String getSource() { + if (pageDoc == null) return ""; + var sourceElement = pageDoc.select("div.source"); + return sourceElement.text(); + } + + @Override + public String getDate() { + if (pageDoc == null) return ""; + var dateElement = pageDoc.select("div.header-time"); + return dateElement.text(); + } + + @Override + public String getContent() { + if (pageDoc == null) return ""; + var contentElement = pageDoc.select("#detail"); + return contentElement.text(); + } +} diff --git a/src/main/java/cmy/newsspider/pageextractor/YouthExtractor.java b/src/main/java/cmy/newsspider/pageextractor/YouthExtractor.java new file mode 100644 index 0000000..b4f29ba --- /dev/null +++ b/src/main/java/cmy/newsspider/pageextractor/YouthExtractor.java @@ -0,0 +1,44 @@ +package cmy.newsspider.pageextractor; + +import cmy.newsspider.record.NewsRecord; + +import java.io.IOException; + +public class YouthExtractor extends PageExtractor { + + + public YouthExtractor(String url) { + super(url); + } + + @Override + public String getTitle() { + if (pageDoc == null) return ""; + var titleElement = pageDoc.select("div.page_title>h1"); + return titleElement.text(); + } + + @Override + public String getSource() { + if (pageDoc == null) return ""; + var sourceElement = pageDoc.select("#source_baidu"); + return sourceElement.text(); + } + + @Override + public String getDate() { + if (pageDoc == null) return ""; + var dateElement = pageDoc.select("#page_right"); + return dateElement.text(); + } + + @Override + public String getContent() { + if (pageDoc == null) return ""; + var contentElement = pageDoc.select("div.page_left>div.page_k2"); + var first = contentElement.first(); + if (first == null) return ""; + return first.text(); + } + +} diff --git a/src/main/java/cmy/newsspider/pageextractor/ZhonghuaExtractor.java b/src/main/java/cmy/newsspider/pageextractor/ZhonghuaExtractor.java new file mode 100644 index 0000000..d5db610 --- /dev/null +++ b/src/main/java/cmy/newsspider/pageextractor/ZhonghuaExtractor.java @@ -0,0 +1,35 @@ +package cmy.newsspider.pageextractor; + +public class ZhonghuaExtractor extends PageExtractor { + public ZhonghuaExtractor(String url) { + super(url); + } + + @Override + public String getTitle() { + if (pageDoc == null) return ""; + var titleElement = pageDoc.select("h1.article_title"); + return titleElement.text(); + } + + @Override + public String getSource() { + if (pageDoc == null) return ""; + var sourceElement = pageDoc.select("span.source"); + return sourceElement.text(); + } + + @Override + public String getDate() { + if (pageDoc == null) return ""; + var dateElement = pageDoc.select("span.time"); + return dateElement.text(); + } + + @Override + public String getContent() { + if (pageDoc == null) return ""; + var contentElement = pageDoc.select("#detail"); + return contentElement.text(); + } +} diff --git a/src/main/java/cmy/newsspider/record/NewsRecord.java b/src/main/java/cmy/newsspider/record/NewsRecord.java new file mode 100644 index 0000000..3c5012d --- /dev/null +++ b/src/main/java/cmy/newsspider/record/NewsRecord.java @@ -0,0 +1,4 @@ +package cmy.newsspider.record; + +public record NewsRecord(String title, String content, String source, String date) { +} diff --git a/src/main/java/cmy/newsspider/searchpageextractor/SearchPageExtractor.java b/src/main/java/cmy/newsspider/searchpageextractor/SearchPageExtractor.java new file mode 100644 index 0000000..95f8769 --- /dev/null +++ b/src/main/java/cmy/newsspider/searchpageextractor/SearchPageExtractor.java @@ -0,0 +1,10 @@ +package cmy.newsspider.searchpageextractor; + +import cmy.newsspider.record.NewsRecord; + +import java.util.ArrayList; + + +public interface SearchPageExtractor { + ArrayList searchByKeyword(String keyword, int maxPage); +} diff --git a/src/main/java/cmy/newsspider/searchpageextractor/SinaSearchPageExtractor.java b/src/main/java/cmy/newsspider/searchpageextractor/SinaSearchPageExtractor.java new file mode 100644 index 0000000..b3e2ce8 --- /dev/null +++ b/src/main/java/cmy/newsspider/searchpageextractor/SinaSearchPageExtractor.java @@ -0,0 +1,114 @@ +package cmy.newsspider.searchpageextractor; + +import cmy.newsspider.pageextractor.SinaExtractor; +import cmy.newsspider.record.NewsRecord; +import org.jsoup.Jsoup; +import org.jsoup.nodes.Document; + +import java.io.IOException; +import java.util.ArrayList; +import java.util.Vector; +import java.util.concurrent.ExecutionException; +import java.util.concurrent.Executor; +import java.util.concurrent.Executors; +import java.util.concurrent.Future; +import java.util.regex.Pattern; + +public class SinaSearchPageExtractor implements SearchPageExtractor { + final static String searchBaseUrl = "https://search.sina.com.cn/news?q=%s&c=news&sort=time"; + + static String getSearchUrl(String keyword) { + return String.format(searchBaseUrl, keyword); + } + + private Document getSearchPage(String keyword) throws IOException { + var searchUrl = getSearchUrl(keyword); + return getSearchPageByUrl(searchUrl); + } + + private Document getSearchPageByUrl(String url) throws IOException { + var pageDoc = Jsoup.connect(url) + .userAgent("Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/94.0.4606.61 Safari/537.36") + .timeout(3000) + .get(); + return pageDoc; + } + + private ArrayList getItemUrls(Document doc) { + var selector = "div.box-result h2>a"; + var itemLinks = doc.select(selector); + var resultLinks = new ArrayList(); + for (var link : + itemLinks) { + resultLinks.add(link.attr("href")); + } + return resultLinks; + } + + private String getNextPageUrl(Document doc) { + var selector = "div.pagebox a[title='下一页']"; + var nextPageTag = doc.select(selector).first(); + if (nextPageTag == null) { + return null; + } + var nextPageLinkText = nextPageTag.attr("href"); + var r = Pattern.compile("javascript:linkPost\\('(.*)','(.*)'\\)"); + var matcher = r.matcher(nextPageLinkText); + if (!matcher.find()) { + return null; + } + return "https://search.sina.com.cn" + matcher.group(1) + matcher.group(2); + } + + private ArrayList getAllItemLink(String keyword, int maxPage) { + var urlList = new ArrayList(); + Document searchPage; + int currentPage = 1; + try { + searchPage = getSearchPage(keyword); + } catch (IOException exception) { + return null; + } + var itemUrls = getItemUrls(searchPage); + urlList.addAll(itemUrls); + + var nextPageUrl = getNextPageUrl(searchPage); + + while (nextPageUrl != null && currentPage < maxPage) { + try { + searchPage = getSearchPageByUrl(nextPageUrl); + itemUrls = getItemUrls(searchPage); + urlList.addAll(itemUrls); + nextPageUrl = getNextPageUrl(searchPage); + currentPage++; + } catch (IOException exception) { + break; + } + } + return urlList; + } + + @Override + public ArrayList searchByKeyword(String keyword, int maxPage) { + var resultRecord = new ArrayList(); + + var allItemLink = getAllItemLink(keyword, maxPage); + + var executor = Executors.newCachedThreadPool(); + var futureList = new ArrayList>(); + for (String link : allItemLink) { + var future = executor.submit(new SinaExtractor(link)); + futureList.add(future); + } + for (var future : + futureList) { + try { + resultRecord.add(future.get()); + } catch (InterruptedException | ExecutionException e) { + e.printStackTrace(); + } + } + executor.shutdown(); + return resultRecord; + } +} diff --git a/src/main/java/cmy/newsspider/searchpageextractor/SogouSearchPageExtractor.java b/src/main/java/cmy/newsspider/searchpageextractor/SogouSearchPageExtractor.java new file mode 100644 index 0000000..de527b6 --- /dev/null +++ b/src/main/java/cmy/newsspider/searchpageextractor/SogouSearchPageExtractor.java @@ -0,0 +1,156 @@ +package cmy.newsspider.searchpageextractor; + +import cmy.newsspider.pageextractor.PageExtractor; +import cmy.newsspider.pageextractor.SinaExtractor; +import cmy.newsspider.record.NewsRecord; +import org.jsoup.Jsoup; +import org.jsoup.nodes.Document; + +import java.io.IOException; +import java.util.ArrayList; +import java.util.concurrent.Callable; +import java.util.concurrent.ExecutionException; +import java.util.concurrent.Executors; +import java.util.concurrent.Future; +import java.util.regex.Pattern; + +public class SogouSearchPageExtractor implements SearchPageExtractor { + private final static String searchBaseUrl = "https://www.sogou.com/sogou?interation=1728053249&query=%s"; + private final static String baseUrl = "https://www.sogou.com"; + private final static String nextPageBaseUrl = "https://www.sogou.com/sogou"; + + public SogouSearchPageExtractor() { + } + + private String getSearchUrl(String keyword) { + return String.format(searchBaseUrl, keyword); + } + + private Document getSearchPage(String keyword) throws IOException { + var searchUrl = getSearchUrl(keyword); + return getSearchPageByUrl(searchUrl); + } + + private Document getSearchPageByUrl(String url) throws IOException { + var pageDoc = Jsoup.connect(url) + .userAgent("Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/94.0.4606.61 Safari/537.36") + .timeout(3000) + .get(); + return pageDoc; + } + + private ArrayList getItemUrls(Document doc) { + var selector = "div.vrwrap h3.vr-title>a"; + var itemLinks = doc.select(selector); + var resultLinks = new ArrayList(); + + var executor = Executors.newCachedThreadPool(); + var futureList = new ArrayList>(); + for (var link : + itemLinks) { + var fullUrl = baseUrl + link.attr("href"); + var future = executor.submit(new UrlConverter(fullUrl)); + futureList.add(future); + } + for (var future : + futureList) { + try { + resultLinks.add(future.get()); + } catch (InterruptedException | ExecutionException e) { + e.printStackTrace(); + } + } + executor.shutdown(); + return resultLinks; + } + + private String getNextPageUrl(Document doc) { + var selector = "a#sogou_next"; + var nextPageTag = doc.select(selector).first(); + if (nextPageTag == null) { + return null; + } + return nextPageBaseUrl + nextPageTag.attr("href"); + } + + private ArrayList getAllItemLink(String keyword, int maxPage) { + var urlList = new ArrayList(); + Document searchPage; + int currentPage = 1; + try { + searchPage = getSearchPage(keyword); + } catch (IOException exception) { + return urlList; + } + var itemUrls = getItemUrls(searchPage); + urlList.addAll(itemUrls); + var nextPageUrl = getNextPageUrl(searchPage); + while (nextPageUrl != null && currentPage < maxPage) { + try { + searchPage = getSearchPageByUrl(nextPageUrl); + itemUrls = getItemUrls(searchPage); + urlList.addAll(itemUrls); + nextPageUrl = getNextPageUrl(searchPage); + currentPage++; + } catch (IOException e) { + e.printStackTrace(); + } + } + return urlList; + } + + @Override + public ArrayList searchByKeyword(String keyword, int maxPage) { + var resultRecord = new ArrayList(); + var allItemLink = getAllItemLink(keyword, maxPage); + var executor = Executors.newCachedThreadPool(); + var futureList = new ArrayList>(); + for (String link : allItemLink) { + var extractor = PageExtractor.getExtractor(link); + if (extractor == null) continue; + var future = executor.submit(extractor); + futureList.add(future); + } + for (var future : + futureList) { + try { + var result = future.get(); + if (result != null) { + resultRecord.add(result); + } + } catch (InterruptedException | ExecutionException e) { + e.printStackTrace(); + } + } + executor.shutdown(); + return resultRecord; + } + + + static class UrlConverter implements Callable { + private final String url; + + public UrlConverter(String url) { + this.url = url; + } + + private String extractRedirectUrl(String scriptStr) { + var r = Pattern.compile("window\\.location\\.replace\\(\"(.*)\"\\)"); + var matcher = r.matcher(scriptStr); + if (!matcher.find()) { + return null; + } + return matcher.group(1); + } + + @Override + public String call() throws Exception { + var pageDoc = Jsoup.connect(url) + .userAgent("Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/94.0.4606.61 Safari/537.36") + .timeout(3000) + .get(); + var scriptStr = pageDoc.select("script").html(); + return extractRedirectUrl(scriptStr); + } + } +} diff --git a/src/main/java/module-info.java b/src/main/java/module-info.java new file mode 100644 index 0000000..3c0042b --- /dev/null +++ b/src/main/java/module-info.java @@ -0,0 +1,4 @@ +module cmy.newsspider { + requires org.jsoup; + requires jdk.crypto.ec; +} \ No newline at end of file