程序员面试金典 17.26

本文探讨了计算多个整数集合间稀疏相似度的方法,包括直接比较、使用倒排索引优化及元素排序策略,旨在减少时间复杂度,解决大规模数据集上的精度问题。

Sparse Similarity:给定一些整数集合,计算集合之间的稀疏相似度。稀疏相似度定义为交集大小和并集大小的比值。

假设有s个集合,每个集合中有n个整数。最简单的方式就是对于每一对集合,查找第一个集合中有多少元素在第二个集合中,这样就算出了交集的大小,最后根据容斥原理计算并集的大小即可。这种方法的时间复杂度为O(s ^ 2 * n ^ 2);如果查找过程用set,那么复杂度降为O(s ^ 2 * nlogn);如果查找过程用unordered_set,那么复杂度降为O(s ^ 2 * n)。根据题干sn的输入规模都会达到5003次方的算法应该是会超时的。

先用这种方法交了一下,然后就出现了评论区中说的四舍五入导致的精度问题,所以要在比值的的最后加上一个epsilon😦😦😦

再来降低一下复杂度,也就是优化一下O(s ^ 2)的部分。如果不想两两全部比较,那就争取只处理相似度不为0的集合对,假设有p个,最坏情况下每一对都有n个整数,则这一部分的时间复杂度为O(pn)。如果要使用这种方法,就要求我们提前能够用某种数据结构表示出相似的部分,亦即对于一个给定的整数x,有哪些集合包含x,这也就是倒排索引,整体的时间复杂度为O(sn + pn)

这道题很难和正确结果进行比较,也不知道预期输出是怎么个算法得来的,最好是找个工具排个序最后再文本比较下。

class Solution {
private:
    unordered_map<int, vector<size_t>> InvertedIndex;
    void createInvertedIndex(const vector<vector<int>> &docs)
    {
        for(size_t i = 0; i < docs.size(); i++)
        {
            const vector<int> &doc = docs[i];
            for(int n : doc)
            {
                InvertedIndex[n].push_back(i);
            }
        }
    }
    map<pair<size_t, size_t>, int> Pair2InterSize;
    void computeIntersectionSize()
    {
        for(auto iter = InvertedIndex.begin(); iter != InvertedIndex.end(); iter++)
        {
            const vector<size_t> &DocList = iter->second;
            if(DocList.size() == 1) continue;
            for(size_t i = 0; i < DocList.size(); i++)
            {
                for(size_t j = i + 1; j < DocList.size(); j++)
                {
                    Pair2InterSize[make_pair(DocList[i], DocList[j])]++;
                }
            }
        }
    }
    vector<string> ans;
    void adjustToSimilarities(const vector<vector<int>> &docs)
    {
        for(auto iter = Pair2InterSize.begin(); iter != Pair2InterSize.end(); iter++)
        {
            size_t IntersectionSize = iter->second;
            size_t UnionSize = docs[iter->first.first].size() + docs[iter->first.second].size() - IntersectionSize;
            ostringstream oss;
            oss << iter->first.first << ',' << iter->first.second << ": ";
            oss << fixed << setprecision(4) << static_cast<double>(IntersectionSize) / static_cast<double>(UnionSize) + 1e-9;
            ans.push_back(oss.str());
        }
    }
public:
    vector<string> computeSimilarities(vector<vector<int>>& docs) {
        createInvertedIndex(docs);
        computeIntersectionSize();
        adjustToSimilarities(docs);
        return ans;
    }
};

书上还给出了另外一种方法,将所有的元素排序,这样相同的元素就会聚到一起,之后的处理方法就和上面的相同了,时间复杂度为O(sn * logsn + pn),和上面不用unordered_map的情况一样,但是运行时间没多大区别。

class Solution {
private:
    struct Element
    {
        int ele;
        size_t DocID;
        Element(int n, size_t ID) : ele(n), DocID(ID){}
        bool operator<(const Element &rhs)
        {
            if(ele < rhs.ele) return true;
            else if(ele == rhs.ele) return DocID < rhs.DocID;
            else return false;
        }
    };
    vector<Element> Sorted;
    void sortDocs(const vector<vector<int>> &docs)
    {
        for(size_t i = 0; i < docs.size(); i++)
        {
            const vector<int> &doc = docs[i];
            for(int n : doc)
            {
                Sorted.push_back(Element(n, i));
            }
        }
        sort(Sorted.begin(), Sorted.end());
    }
    map<pair<size_t, size_t>, int> Pair2InterSize;
    void computeIntersectionSize()
    {
        for(size_t i = 0; i < Sorted.size(); i++)
        {
            size_t j = i + 1;
            while(j < Sorted.size() && Sorted[j].ele == Sorted[i].ele){
                Pair2InterSize[make_pair(Sorted[i].DocID, Sorted[j].DocID)]++;
                j++;
            }
        }
    }
    vector<string> ans;
    void adjustToSimilarities(const vector<vector<int>> &docs)
    {
        for(auto iter = Pair2InterSize.begin(); iter != Pair2InterSize.end(); iter++)
        {
            size_t IntersectionSize = iter->second;
            size_t UnionSize = docs[iter->first.first].size() + docs[iter->first.second].size() - IntersectionSize;
            ostringstream oss;
            oss << iter->first.first << ',' << iter->first.second << ": ";
            oss << fixed << setprecision(4) << static_cast<double>(IntersectionSize) / static_cast<double>(UnionSize) + 1e-9;
            ans.push_back(oss.str());
        }
    }
public:
    vector<string> computeSimilarities(vector<vector<int>>& docs) {
        sortDocs(docs);
        computeIntersectionSize();
        adjustToSimilarities(docs);
        return ans;
    }
};
内容概要:本文系统研究了Picard迭代法在非线性常微分方程参数估计中的应用,深入阐述了该方法的数学原理及其在参数辨识中的收敛性与稳定性优势。通过构建最小化误差的目标函数,并结合数值积分技术,采用迭代方式逐步逼近系统的真实参数值,有效解决了非线性动态系统中因缺乏解析解而难以进行精确建模的问题。文中提供了完整的Matlab代码实现,涵盖模型定义、迭代求解、参数更新与结果可视化等关键环节,增强了方法的可操作性与工程实用性。研究通过型非线性系统案例验证了算法的有效性,展示了其在科学计算与工程建模中的良好适应性与推广潜力。; 适合人群:具备常微分方程理论、数值分析基础及Matlab编程能力,从事系统建模、参数辨识、动力学仿真等相关方向的研究生、科研人员和工程技术开发者。; 使用场景及目标:①解决实际工程中非线性微分方程模型的未知参数估计问题;②深入理解Picard迭代法在科学计算中的实现机制与数值特性;③为学术论文复现、科研项目开发或课程设计提供可运行、易调试的技术方案与代码参考。; 阅读建议:建议读者结合文中的数学推导与Matlab代码逐行分析,重点关注迭代流程、目标函数构造与数值积分的耦合实现,通过修改模型结构或噪声条件进行扩展实验,以深化对算法鲁棒性与适用边界的理解。配套资源可通过指定公众号和网盘链接获取,推荐同步学习以加速科研进程。
内容概要:本文详细介绍了一种基于多尺度集成极限学习机(Extreme Learning Machine, ELM)的回归方法,并提供了完整的Matlab代码实现。该方法通过构建多尺度特征表示与集成学习机制,有效提升了ELM在处理非线性、高维复杂数据时的预测精度与模型鲁棒性,特别适用于时间序列回归任务。文档不仅阐述了算法的核心原理与技术流程,还系统展示了其在风电功率预测等工程场景中的应用潜力。同时,文中附带了丰富的科研仿真案例集合,涵盖智能优化算法、深度学习、信号处理、电力系统调度等多个前沿方向,体现了多学科交叉融合的技术优势与实践价值。; 适合人群:具备一定Matlab编程能力,从事科学研究或工程应用的研究生、科研人员及工程技术开发者,尤其适合专注于机器学习、智能算法优化、新能源预测与电力系统建模等相关领域的专业人员。; 使用场景及目标:①用于风电、光伏、负荷等时间序列数据的高精度回归预测任务;②为科研工作者提供可复现的多尺度集成ELM模型代码框架,支持快速算法验证与二次开发;③满足实际工程项目中对高效建模、实时预测与智能决策的技术需求。; 阅读建议:建议读者结合所提供的Matlab代码进行动手实践,深入理解多尺度特征构造与集成策略的设计思想,同时可参考文档中其他相关算法案例进行横向比较与综合应用,以提升整体科研创新能力。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值