在软件缺陷预测中使用软件可视化和迁移学习-人工智能-PHP中文网

首页

科技周边

人工智能

在软件缺陷预测中使用软件可视化和迁移学习

WBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWB

Apr 13, 2023 pm 02:43 PM

软件迁移学习

论文的数据集和代码已开源：https://zenodo.org/record/3373409#.YrpiEBVBxHW。

文章的动机是避开源代码的中间表示，将源代码表示为图像，直接提取代码的语义信息以改进缺陷预测的性能。

首先，看到如下图所示的motivation示例。File1.java和File2.java两个示例中，虽然都包含了1个if语句、2个for语句和4个函数调用，但代码的语义和结构特征是不相同的。为验证将源代码转换成图像是否有助于区分不同的代码，作者进行了实验：将源代码根据字符的ASCII十进制数对应到像素，排列成像素矩阵，获取源代码的图像。作者指出，不同的源代码图像存在差异。

在软件缺陷预测中使用软件可视化和迁移学习

Fig. 1 Motivation Example

文章主要的贡献如下：

将代码转换成图像，从中提取语义和结构信息；

提出一种端到端的框架，结合自注意力机制和迁移学习实现缺陷预测。

文章提出的模型框架如图2所示，分为两个阶段：源代码可视化和深度迁移学习建模。

在软件缺陷预测中使用软件可视化和迁移学习

Fig. 2 Framework

1.源代码可视化

文章将源代码转换成6个图像，过程如图3所示。将源代码字符的10进制ASCII码转换成8bit无符号整数向量，按行和列对这些向量进行排列，生成图像矩阵。8bit整数直接对应到灰度等级。为解决原始数据集较小的问题，作者在文章中提出了一种基于颜色增强的数据集扩充方法：对R、G、B三个颜色通道的值进行排列组合，产生6个彩色图。这里看着挺迷的，变换了通道值后，语义和结构信息应该有所改变吧？但是作者在脚注上进行了解释，如图4所示。

在软件缺陷预测中使用软件可视化和迁移学习

Fig. 3 源代码可视化流程

在软件缺陷预测中使用软件可视化和迁移学习

Fig. 4 文章脚注2

2.深度迁移学习建模

文章使用DAN网络来捕获源代码的语义和结构信息。为增强模型对重要信息的表达能力，作者在原始DAN结构中加入了Attention层。训练与测试流程如图5所示，其中conv1-conv5来自于AlexNet，4个全连接层fc6-fc9作为分类器。作者提到，对于一个新的项目，训练深度学习模型需要有大量的标签数据，这是困难的。所以，作者首先在ImageNet 2012上训练了一个预训练模型，使用预训练模型的参数作为初始参数来微调所有卷积层，进而减少代码图像和ImageNet 2012中图像的差异。

在软件缺陷预测中使用软件可视化和迁移学习

Fig. 5 训练与测试流程

3.模型训练和预测

对Source项目中有标签的代码和Target项目中无标签的代码生成代码图像，同时送入模型；二者共享卷积层和Attention层来提取各自的特征。在全连接层计算Source和Target之间的MK-MDD（Multi Kernel Variant Maximum Mean Discrepancy）。由于Target没有标签，所以只对Source计算交叉熵。模型使用mini-batch随机梯度下降沿着损失函数训练模型。对每一个对的500个epoch，根据最好的F-measure从中选出一个epoch。

在实验部分，作者选择了PROMISE数据仓库中所有开源的Java项目，收集了它们的版本号、class name、是否存在bug的标签。根据版本号和class name在github中下载源码。最终，共采集了10个Java项目的数据。数据集结构如图6所示。

在软件缺陷预测中使用软件可视化和迁移学习

Fig. 6 数据集结构

对于项目内缺陷预测，文章选择如下baseline模型进行对比：

在软件缺陷预测中使用软件可视化和迁移学习

对于跨项目缺陷预测，文章选择如下baseline模型进行对比：

在软件缺陷预测中使用软件可视化和迁移学习

总结一下，虽然是两年前的论文了，但感觉思路还是比较新奇的，避开AST等一系列代码中间表示，直接将代码转换成图像提取特征。但是还是比较疑惑，代码转换成的图像真的包含源代码语义和结构信息吗？感觉可解释性不太强，哈哈。后面需要做实验分析下吧。

以上是在软件缺陷预测中使用软件可视化和迁移学习的详细内容。更多信息请关注PHP中文网其他相关文章！

声明

本文转载于：51CTO.COM。如有侵权，请联系admin@php.cn删除

拥抱面部是否7B型号奥林匹克赛车击败克劳德3.7？Apr 23, 2025 am 11:49 AM

拥抱Face的OlympicCoder-7B：强大的开源代码推理模型开发以代码为中心的语言模型的竞赛正在加剧，拥抱面孔与强大的竞争者一起参加了比赛：OlympicCoder-7B，一种产品

4个新的双子座功能您可以错过Apr 23, 2025 am 11:48 AM

你们当中有多少人希望AI可以做更多的事情，而不仅仅是回答问题？我知道我有，最近，我对它的变化感到惊讶。 AI聊天机器人不仅要聊天，还关心创建，研究

Camunda为经纪人AI编排编写了新的分数Apr 23, 2025 am 11:46 AM

随着智能AI开始融入企业软件平台和应用程序的各个层面（我们必须强调的是，既有强大的核心工具，也有一些不太可靠的模拟工具），我们需要一套新的基础设施能力来管理这些智能体。总部位于德国柏林的流程编排公司Camunda认为，它可以帮助智能AI发挥其应有的作用，并与新的数字工作场所中的准确业务目标和规则保持一致。该公司目前提供智能编排功能，旨在帮助组织建模、部署和管理AI智能体。从实际的软件工程角度来看，这意味着什么？确定性与非确定性流程的融合该公司表示，关键在于允许用户（通常是数据科学家、软件

策划的企业AI体验是否有价值？Apr 23, 2025 am 11:45 AM

参加Google Cloud Next '25，我渴望看到Google如何区分其AI产品。有关代理空间（此处讨论）和客户体验套件（此处讨论）的最新公告很有希望，强调了商业价值

如何为抹布找到最佳的多语言嵌入模型？Apr 23, 2025 am 11:44 AM

为您的检索增强发电（RAG）系统选择最佳的多语言嵌入模型在当今的相互联系的世界中，建立有效的多语言AI系统至关重要。强大的多语言嵌入模型对于RE至关重要

麝香：奥斯汀的机器人需要每10,000英里进行干预Apr 23, 2025 am 11:42 AM

特斯拉的Austin Robotaxi发射：仔细观察Musk的主张埃隆·马斯克（Elon Musk）最近宣布，特斯拉即将在德克萨斯州奥斯汀推出的Robotaxi发射，最初出于安全原因部署了一支小型10-20辆汽车，并有快速扩张的计划。 h

AI震惊的枢轴：从工作工具到数字治疗师和生活教练Apr 23, 2025 am 11:41 AM

人工智能的应用方式可能出乎意料。最初，我们很多人可能认为它主要用于代劳创意和技术任务，例如编写代码和创作内容。然而，哈佛商业评论最近报道的一项调查表明情况并非如此。大多数用户寻求人工智能的并非是代劳工作，而是支持、组织，甚至是友谊！报告称，人工智能应用案例的首位是治疗和陪伴。这表明其全天候可用性以及提供匿名、诚实建议和反馈的能力非常有价值。另一方面，营销任务（例如撰写博客、创建社交媒体帖子或广告文案）在流行用途列表中的排名要低得多。这是为什么呢？让我们看看研究结果及其对我们人类如何继续将