文章摘要显示实现

本文介绍如何利用Jsoup开源包去除HTML标签,返回纯文本,并提供了一个按指定长度截取纯文本字符串的方法。

摘要生成于 C知道 ,由 DeepSeek-R1 满血版支持, 前往体验 >

原理流程:去掉html所有的标签,返回纯文本字符串-》将纯文本字符串按指定长度截取

 1,去除掉HTML里面所有标签,使用Jsoup开源包

/**
         * 去除掉HTML里面所有标签,使用Jsoup开源包
         * <p>Title: getTextFromTHML</p>
         * <p>Description: </p>
         * @param htmlStr html标签字符串
         * @return 纯文本
         */
        public static String getTextFromTHML(String htmlStr) {
            Document doc = Jsoup.parse(htmlStr);
            String text = doc.text();
            // remove extra white space
            StringBuilder builder = new StringBuilder(text);
            int index = 0;
            while(builder.length()>index){
                char tmp = builder.charAt(index);
                if(Character.isSpaceChar(tmp) || Character.isWhitespace(tmp)){
                    builder.setCharAt(index, ' ');
                }
                index++;
            }
            text = builder.toString().replaceAll(" +", " ").trim();
            return text;
        }

 

2,将纯文本字符串按指定长度截取

 /**  
         * 判断传进来的字符串,是否  
         * 大于指定的字节,如果大于递归调用
         * 直到小于指定字节数 ,一定要指定字符编码,因为各个系统字符编码都不一样,字节数也不一样 
         *src 传入的字符串
         *cutSize 截取的大小长度
         */ 
        public String cutString(String src,int cutSize) throws Exception{
            int changdu = src.getBytes("UTF-8").length;
            if(changdu > cutSize){
                src = src.substring(0, src.length()-1);
                src=cutString(src, cutSize);
            }
            return src;
        }

 

maven配置:

<!-- jsoup -->
        <dependency>
    <groupId>org.jsoup</groupId>
    <artifactId>jsoup</artifactId>
    <version>1.7.3</version>
    </dependency>

 

转载于:https://www.cnblogs.com/zy2009/p/7062532.html

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值