ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

牛客网 HJ25 数据分类处理

牛客网 HJ25 数据分类处理 牛客网 HJ25 数据分类处理一、原题完整题目题号HJ25题目名称数据分类处理知识点字符串、列表、去重、排序、模拟、较难题目描述信息社会有大量数据需要分类处理。给定一组数据集I一组分类规则R。规范化规则R去重然后从小到大升序排序得到新规则列表r。依次拿规范化后的每一条规则ri遍历数据集I判断把数字当成字符串如果I里面某个数字包含ri的数字串作为连续子串这条数据符合规则。例ri23I数字231 →23在231里面满足。输出要求只输出能匹配到数据的规则一条规则一条规则依次输出。单条规则输出顺序规则数字→匹配到的数据条数→索引0开始的数据下标→该位置上的数据。最开头第一个数字整个输出序列一共有多少个数字。重点细节数据集I、规则R输入的第一个数字是总数后面才是真正数据读取时要把第一个数字丢掉索引从0开始没有匹配数据的规则直接丢弃不输出。输入描述两行输入第一行第一个整数n后面跟着n个整数构成数据集I。第二行第一个整数m后面跟着m个整数构成规则集R。输出描述一行数字空格隔开。第一个数字代表后面一共有多少个数字后面跟着所有匹配结果。示例1输入15 123 456 786 453 46 7 5 3 665 453456 745 456 786 453 123 5 6 3 6 3 0输出30 3 6 0 123 3 453 7 3 9 453456 13 453 14 123 6 7 1 456 2 786 4 46 8 665 9 453456 11 456 12 786说明原始R6,3,6,3,0去重排序后 r 0,3,6规则0数据集里没有数字包含0直接跳过不输出。规则3找到5条匹配数据依次输出3 5 0 123 3 453 7 3 9 453456 13 453 14 123规则6找到7条匹配数据依次输出6 7 1 456 2 786 4 46 8 665 9 453456 11 456 12 786把所有输出数字拼在一起总共有30个数字放在最前面。二、费曼学习法拆解本题破解过程讲给零基础小白费曼四步确定主题 →大白话讲解 →找出漏洞 →简化重讲Step1确定主题任务给一堆数字一堆匹配规则。规则先去重从小到大排序拿每个规则去原始数据里找数字如果数字里面包含规则数字的字符串就记录它的下标和值最后按规定格式打包输出。核心难点输入读取丢弃首数字、数字转字符串做子串匹配、严格的输出格式开头要统计总元素数量。核心匹配逻辑数字不是做大小比较是当成字符串看有没有连续子串规则3数据123→字符串3在123里面匹配成功。Step2大白话讲解假装教小白拿样例举例输入数据集一行15 123 456 ...开头15是一共有15个数据直接扔掉15后面15个数字才是I。规则一行5 6 3 6 3 0开头5是规则总数扔掉5剩下[6,3,6,3,0]。第一步处理规则去掉重复数字6,3,0从小到大排序 →0,3,6。第二步遍历每一条规范化规则规则0逐个检查I里面的所有数字看数字字符串里面有没有字符0一条都没有 →这个规则直接抛弃不输出任何东西。规则3遍历全部I凡是数字字符串包含3的记录【下标数字】。一共找到5条。这一组输出片段3 5 下标1 数值1 下标2 数值2 ...规则6遍历全部I凡是数字字符串包含6的记录【下标数字】一共7条。这一组输出片段6 7 下标1 数值1 ...第三步把上面所有有效片段拼成长长的一个列表。这个列表有多少个数字把这个数量放在整个结果的最前面然后全部打印。类比理解你手里有一堆商品数据集I每个商品带编号索引一堆筛选条件规则R。先清理筛选条件删掉重复条件条件从小到大排。挨个条件筛选商品满足条件的商品记下编号和商品本身没有商品满足的条件丢掉。最后汇总所有筛选结果统计总条目数量数量写在最前面一次性全部打印。Step3找出漏洞新手踩坑重点✅坑1输入的第一个数字是计数很多新手直接全部拿来当数据结果完全错误。例如输入15 a b c...15只是告诉你后面有15个数丢弃。✅坑2去重之后排序排序必须按数字大小排不能直接字符串排序。错误例子字符串排序[10,6]会排成10,6数字排序应该6,10。✅坑3匹配方式字符串包含不是数字大小比较规则是3数据30→3在30里面匹配成功。✅坑4没有匹配数据的规则直接丢弃不要输出。✅坑5输出最开头是后面所有数字的总个数不是规则数量不是匹配的数据条数很多人这里算错直接OJ判错。✅坑6下标从0开始不是1Step4简化重述一句话总结读取两行每行丢掉第一个计数数字拿到原始数据集、原始规则。规则去重再按数字从小到大排序。遍历每一条规则遍历数据集把包含该规则字符串的【下标、值】收集起来收集不为空则打包规则匹配条数下标值...加入总结果列表。在总结果列表最前面插入列表长度最后空格打印全部数字。三、Python代码实现每行最大注释# 读取第一行数据集整行字符串按空格分割成字符串列表line1input().split()# line1[0]是数据总数舍弃剩下全部转为字符串存入data_list保留字符串方便后面子串查找data_listline1[1:]# 读取第二行规则整行字符串分割line2input().split()# line2[0]是规则总数舍弃剩下为原始规则字符串列表raw_ruleline2[1:]# 第一步规则去重。set自动去重转列表unique_rulelist(set(raw_rule))# 第二步按数字大小从小到大排序。keyint代表把字符串转整数再比较避免字符串排序bugunique_rule.sort(keylambdax:int(x))# 创建全局总结果列表用来保存所有要输出的数字final_result[]# 遍历每一条规范化后的规则forruleinunique_rule:# 临时列表保存当前这条规则匹配到的【下标数据】成对信息match_items[]# enumerate同时拿到索引idx和数据val索引自动从0开始foridx,valinenumerate(data_list):# 判断规则字符串是否在数据字符串里面连续子串ifruleinval:# 匹配成功先加入下标再加入数值match_items.append(str(idx))match_items.append(val)# 如果match_items不为空说明这条规则有匹配数据才加入最终结果iflen(match_items)0:# 当前规则的输出片段规则 匹配个数 匹配的下标数值对countstr(len(match_items)//2)# 每一组是2个元素idx,val除以2得到匹配数量final_result.append(rule)final_result.append(count)# 把所有匹配的下标、数据追加进最终列表final_result.extend(match_items)# 最重要一步在最前面插入整个final_result里面元素的总个数# len(final_result)就是后面一共有多少数字转为字符串final_result.insert(0,str(len(final_result)))# 使用空格拼接列表全部元素打印一行输出满足牛客OJ格式print( .join(final_result))测试样例验证输入15 123 456 786 453 46 7 5 3 665 453456 745 456 786 453 123 5 6 3 6 3 0data_list拿到后面15个数字字符串。raw_rule拿到[6,3,6,3,0]unique_rule去重后[6,3,0]按数字排序得到[0,3,6]rule0没有匹配跳过rule3匹配5组下标值片段加入final_resultrule6匹配7组下标值片段加入final_resultfinal_result总长度30插入到列表最前面输出结果和样例完全一致 ✔四、应用场景举例日志过滤系统服务器日志是一行行数字编号配置多个过滤关键词规则规则自动去重排序筛选日志输出命中日志编号、原始记录位置。和本题逻辑一模一样。手机号筛选海量手机号列表设置筛选规则查找包含指定数字段的手机号比如包含139、138提取符合条件号码、原始序号。商品编码检索电商系统商品编码为一串数字批量筛选包含特定数字片段的商品按筛选条件分组输出每组匹配数量、商品位置、编码。身份证号筛查从一批身份证号码中查找包含指定出生年月片段的记录分组统计导出结果。五、费曼自测检验吃透HJ25为什么排序的时候必须写keylambda x:int(x)如果去掉会发生什么错误直接字符串排序10’会排在’6’前面不符合数字从小到大的要求。输入每行第一个数字我们怎么处理为什么直接丢弃它仅代表后面数据个数不是业务数据。match_items里面每两条是一组所以匹配数量 len(match_items)//2为什么每匹配一条数据append下标、append数值一次增加2个元素。最终输出列表第一个数字代表什么后面整串输出一共有多少个数字不是规则数目不是匹配数据总数。拓展HJ25是模拟字符串处理机考题考点多细节机考很容易因为小细节丢分考察读题细心程度、字符串操作、去重排序。
返回列表