c# - 如何调试托管堆中的损坏

标签 c# .net .net-4.0 windbg heap-corruption

我的程序抛出了一个 catch(Exception e) 块无法处理的错误,然后它崩溃了:

Access Violation Corrupted State Exception.



这很奇怪,因为据我所知,损坏的状态异常是从非托管代码抛出的,而在这里我在调用 StringBuilder 方法时得到了这个异常。

代码在后台线程中运行,并且不时崩溃,无法轻松重现。因此,我将 WinDbg 附加到该进程并具有以下异常堆栈:
000000001dabd8c8 000007feea129a1d [HelperMethodFrame: 000000001dabd8c8]
000000001dabda00 000007fee90cfce8 System.Text.StringBuilder.ExpandByABlock(Int32)
000000001dabda40 000007fee90cfba4 System.Text.StringBuilder.Append(Char*, Int32)
000000001dabdaa0 000007fee9102955 System.Text.StringBuilder.Append(System.String, Int32, Int32)
000000001dabdaf0 000007ff00bf5ce3 MineUtils.Common.Strings.Strings.Replace(System.String, System.String, System.String, Boolean, Boolean)
000000001dabdb90 000007ff00bf5a59 MineUtils.Common.Strings.Strings.RemoveSubstrings(System.String, System.String, System.String, Boolean) [D:\Programs\Visual Studio 2005 Projects\MineUtils.Common\Strings\Strings.Common-Main.cs @ 1481

WinDbg 显示发生此异常:
EXCEPTION_RECORD:  ffffffffffffffff -- (.exr 0xffffffffffffffff)
ExceptionAddress: 000007feea129a1d (clr!WKS::gc_heap::find_first_object+0x0000000000000092)
   ExceptionCode: c0000005 (Access violation)
  ExceptionFlags: 00000000
NumberParameters: 2
   Parameter[0]: 0000000000000000
   Parameter[1]: 0000000000003d80
Attempt to read from address 0000000000003d80

我读到可以使用方法属性 [HandleProcessCorruptedStateExceptions] 处理此类异常,但是如果我只使用 StringBuilder,为什么会发生此异常?

这是之前的WinDbg分析(StringBuilder.ToString()导致异常):
*******************************************************************************
*                                                                             *
*                        Exception Analysis                                   *
*                                                                             *
*******************************************************************************

FAULTING_IP:
clr!WKS::gc_heap::find_first_object+92
000007fe`ea129a1d f70100000080    test    dword ptr [rcx],80000000h

EXCEPTION_RECORD:  ffffffffffffffff -- (.exr 0xffffffffffffffff)
ExceptionAddress: 000007feea129a1d (clr!WKS::gc_heap::find_first_object+0x0000000000000092)
   ExceptionCode: c0000005 (Access violation)
  ExceptionFlags: 00000001
NumberParameters: 2
   Parameter[0]: 0000000000000000
   Parameter[1]: 0000000000001c98
Attempt to read from address 0000000000001c98

ERROR_CODE: (NTSTATUS) 0xc0000005 - The instruction at 0x%08lx referenced memory at 0x%08lx. The memory could not be %s.

EXCEPTION_CODE: (NTSTATUS) 0xc0000005 - The instruction at 0x%08lx referenced memory at 0x%08lx. The memory could not be %s.

EXCEPTION_PARAMETER1:  0000000000000000

EXCEPTION_PARAMETER2:  0000000000001c98

READ_ADDRESS:  0000000000001c98

FOLLOWUP_IP:
clr!WKS::gc_heap::find_first_object+92
000007fe`ea129a1d f70100000080    test    dword ptr [rcx],80000000h

MOD_LIST: <ANALYSIS/>

NTGLOBALFLAG:  0

APPLICATION_VERIFIER_FLAGS:  0

MANAGED_STACK:
(TransitionMU)
000000001AB7DFC0 000007FEE90CFE07 mscorlib_ni!System.Text.StringBuilder.ToString()+0x27
000000001AB7E010 000007FF00C750A9 SgmlReaderDll!Sgml.Entity.ScanToken(System.Text.StringBuilder, System.String, Boolean)+0x169
000000001AB7E080 000007FF00C760E6 SgmlReaderDll!Sgml.SgmlDtd.ParseParameterEntity(System.String)+0xc6
000000001AB7E0F0 000007FF00C76FD8 SgmlReaderDll!Sgml.SgmlDtd.ParseModel(Char, Sgml.ContentModel)+0x298
000000001AB7E160 000007FF00C7701C SgmlReaderDll!Sgml.SgmlDtd.ParseModel(Char, Sgml.ContentModel)+0x2dc
000000001AB7E1D0 000007FF00C7701C SgmlReaderDll!Sgml.SgmlDtd.ParseModel(Char, Sgml.ContentModel)+0x2dc
000000001AB7E240 000007FF00C76BA5 SgmlReaderDll!Sgml.SgmlDtd.ParseContentModel(Char)+0x65
000000001AB7E290 000007FF00C763D7 SgmlReaderDll!Sgml.SgmlDtd.ParseElementDecl()+0xe7
000000001AB7E320 000007FF00C747A1 SgmlReaderDll!Sgml.SgmlDtd.Parse()+0xc1
000000001AB7E370 000007FF00C73EF5 SgmlReaderDll!Sgml.SgmlDtd.Parse(System.Uri, System.String, System.IO.TextReader, System.String, System.String, System.Xml.XmlNameTable)+0x175
000000001AB7E410 000007FF00C73B33 SgmlReaderDll!Sgml.SgmlReader.LazyLoadDtd(System.Uri)+0x163
000000001AB7E480 000007FF00C737B9 SgmlReaderDll!Sgml.SgmlReader.OpenInput()+0x19
000000001AB7E4E0 000007FF00C7334C SgmlReaderDll!Sgml.SgmlReader.Read()+0x1c
000000001AB7E530 000007FEE5983C4C System_Xml_ni!System.Xml.XmlLoader.Load(System.Xml.XmlDocument, System.Xml.XmlReader, Boolean)+0xac
000000001AB7E590 000007FEE5983730 System_Xml_ni!System.Xml.XmlDocument.Load(System.Xml.XmlReader)+0x90
...
000000001AB7F0A0 000007FEE97ED792 mscorlib_ni!System.Threading.Tasks.Task.Execute()+0x82
000000001AB7F100 000007FEE90A181C mscorlib_ni!System.Threading.ExecutionContext.Run(System.Threading.ExecutionContext, System.Threading.ContextCallback, System.Object, Boolean)+0xdc
000000001AB7F160 000007FEE97E7F95 mscorlib_ni!System.Threading.Tasks.Task.ExecuteWithThreadLocal(System.Threading.Tasks.Task ByRef)+0x1b5
000000001AB7F1E0 000007FEE97E7D90 mscorlib_ni!System.Threading.Tasks.Task.ExecuteEntry(Boolean)+0xb0
000000001AB7F220 000007FEE90EBA83 mscorlib_ni!System.Threading.ThreadPoolWorkQueue.Dispatch()+0x193
000000001AB7F2C0 000007FEE90EB8D5 mscorlib_ni!System.Threading._ThreadPoolWaitCallback.PerformWaitCallback()+0x35
(TransitionUM)

EXCEPTION_OBJECT: !pe 2a61228
Exception object: 0000000002a61228
Exception type:   System.ExecutionEngineException
Message:          <none>
InnerException:   <none>
StackTrace (generated):
<none>
StackTraceString: <none>
HResult: 80131506

MANAGED_OBJECT_NAME:  System.ExecutionEngineException

MANAGED_STACK_COMMAND:  _EFN_StackTrace

LAST_CONTROL_TRANSFER:  from 000007feea12bce4 to 000007feea129a1d

ADDITIONAL_DEBUG_TEXT:  Followup set based on attribute [Is_ChosenCrashFollowupThread] from Frame:[0] on thread:[PSEUDO_THREAD]

FAULTING_THREAD:  ffffffffffffffff

DEFAULT_BUCKET_ID:  INVALID_POINTER_READ_CALL

PRIMARY_PROBLEM_CLASS:  INVALID_POINTER_READ_CALL

BUGCHECK_STR:  APPLICATION_FAULT_INVALID_POINTER_READ_WRONG_SYMBOLS_CALL__SYSTEM.EXECUTIONENGINEEXCEPTION

再次更新

这是启用 paged heap 后异常的 WinDbg 堆栈:
 (1480.e84): Access violation - code c0000005 (first chance)
ntdll!ZwTerminateProcess+0xa:
00000000`77c415da c3              ret
0:023> !clrstack
OS Thread Id: 0xe84 (23)
Child SP         IP               Call Site
0000000037ded848 0000000077c415da [HelperMethodFrame: 0000000037ded848]
0000000037dedab0 000007fee9effd17 System.Text.StringBuilder.ToString()*** WARNING: Unable to verify checksum for C:\Windows\assembly\NativeImages_v4.0.30319_64\mscorlib\8f7f691aa155c11216387cf3420d9d1b\mscorlib.ni.dll

0000000037dedb00 000007ff00cceae9 Sgml.Entity.ScanToken(System.Text.StringBuilder, System.String, Boolean)

0000000037dedb70 000007ff00cd19b2 Sgml.SgmlDtd.ParseAttDefault(Char, Sgml.AttDef)
0000000037dedbc0 000007ff00cd120b Sgml.SgmlDtd.ParseAttDef(Char)
0000000037dedc00 000007ff00cd1057 Sgml.SgmlDtd.ParseAttList(System.Collections.Generic.Dictionary`2<System.String,Sgml.AttDef>, Char)
0000000037dedc50 000007ff00cd10cd Sgml.SgmlDtd.ParseAttList(System.Collections.Generic.Dictionary`2<System.String,Sgml.AttDef>, Char)
0000000037dedca0 000007ff00cd0e9a Sgml.SgmlDtd.ParseAttList()
0000000037dedd10 000007ff00cce1f1 Sgml.SgmlDtd.Parse()
0000000037dedd60 000007ff00ccd945 Sgml.SgmlDtd.Parse(System.Uri, System.String, System.IO.TextReader, System.String, System.String, System.Xml.XmlNameTable)
0000000037dede00 000007ff00ccd582 Sgml.SgmlReader.LazyLoadDtd(System.Uri)
0000000037dede70 000007ff00ccd1f9 Sgml.SgmlReader.OpenInput()
0000000037deded0 000007ff00cccd8c Sgml.SgmlReader.Read()
0000000037dedf20 000007fee67b3bfc System.Xml.XmlLoader.Load(System.Xml.XmlDocument, System.Xml.XmlReader, Boolean)*** WARNING: Unable to verify checksum for C:\Windows\assembly\NativeImages_v4.0.30319_64\System.Xml\8e4323f5bfb90be4621456033d8b404b\System.Xml.ni.dll
*** ERROR: Module load completed but symbols could not be loaded for C:\Windows\assembly\NativeImages_v4.0.30319_64\System.Xml\8e4323f5bfb90be4621456033d8b404b\System.Xml.ni.dll

0000000037dedf80 000007fee67b36e0 System.Xml.XmlDocument.Load(System.Xml.XmlReader)
[deleted]
0000000037deea90 000007feea61d432 System.Threading.Tasks.Task.Execute()
0000000037deeaf0 000007fee9ed17ec System.Threading.ExecutionContext.Run(System.Threading.ExecutionContext, System.Threading.ContextCallback, System.Object, Boolean)
0000000037deeb50 000007feea617c35 System.Threading.Tasks.Task.ExecuteWithThreadLocal(System.Threading.Tasks.Task ByRef)
0000000037deebd0 000007feea617a30 System.Threading.Tasks.Task.ExecuteEntry(Boolean)
0000000037deec10 000007fee9f1b953 System.Threading.ThreadPoolWorkQueue.Dispatch()
0000000037deecb0 000007fee9f1b7a5 System.Threading._ThreadPoolWaitCallback.PerformWaitCallback()
0000000037def310 000007feeae4dc54 [DebuggerU2MCatchHandlerFrame: 0000000037def310]
0:023> !verifyheap
-verify will only produce output if there are errors in the heap
The garbage collector data structures are not in a valid state for traversal.
It is either in the "plan phase," where objects are being moved around, or
we are at the initialization or shutdown of the gc heap. Commands related to
displaying, finding or traversing objects as well as gc heap segments may not
work properly. !dumpheap and !verifyheap may incorrectly complain of heap
consistency errors.
object 000000000e34caf8: bad member 000000001024b9a0 at 000000000e34cb08
curr_object:      000000000e34caf8
Last good object: 000000000e34cab0
----------------
0:023> !analyze
Last event: 1480.e84: Exit process 0:1480, code 80131506
  debugger time: Sun Sep 18 14:22:42.592 2011 (UTC + 1:00)
0:023> !analyze -v
Last event: 1480.e84: Exit process 0:1480, code 80131506
  debugger time: Sun Sep 18 14:22:42.592 2011 (UTC + 1:00)
0:023> .do e34cab0
          ^ Syntax error in '.do e34cab0'
0:023> !do e34cab0
Name:        System.String
MethodTable: 000007feea026870
EEClass:     000007fee9baed58
Size:        72(0x48) bytes
File:        C:\Windows\Microsoft.Net\assembly\GAC_64\mscorlib\v4.0_4.0.0.0__b77a5c561934e089\mscorlib.dll
String:      appliedFiltersContainer
Fields:
              MT    Field   Offset                 Type VT     Attr            Value Name
000007feea02c758  4000103        8         System.Int32  1 instance               23 m_stringLength
000007feea02b298  4000104        c          System.Char  1 instance               61 m_firstChar
000007feea026870  4000105       10        System.String  0   shared           static Empty
                                 >> Domain:Value  00000000021343a0:000000000db21420 <<
0:023> !do e34caf8
<Note: this object has an invalid CLASS field>
Name:        System.Reflection.RuntimeAssembly
MethodTable: 000007feea02a128
EEClass:     000007fee9baf968
Size:        48(0x30) bytes
File:        C:\Windows\Microsoft.Net\assembly\GAC_64\mscorlib\v4.0_4.0.0.0__b77a5c561934e089\mscorlib.dll
Fields:
              MT    Field   Offset                 Type VT     Attr            Value Name
000007feea9ef7f0  4000e14        8 ...solveEventHandler  0 instance 0000000000000000 _ModuleResolve
000007feea036338  4000e15       10 ...che.InternalCache  0 instance 000000001024b9a0 m_cachedData
000007feea0259c8  4000e16       18        System.Object  0 instance 000000000e3abd18 m_syncRoot
000007feea033450  4000e17       20        System.IntPtr  1 instance         37a95f10 m_assembly

它可以是什么?

最佳答案

最近,我遇到了托管堆损坏,这对我来说是新鲜事。我对它感到非常沮丧,必须学习很多东西才能调试它。我要感谢 Seva Titov,他给了我正确的开始方向。他的回答简洁明了,非常有帮助。我想记录我为调试问题而采取的操作以供我自己引用。可能这对其不熟悉的其他人会有所帮助。

.NET 4 中的调试堆损坏:

如何怀疑堆损坏?

简要地:

  • 应用程序随机崩溃而不考虑应用的异常捕获,甚至通过像 catch(Exception) 这样的毯子。应该捕获所有异常。
  • 检查应用程序崩溃转储中的 CLR 堆栈会显示堆栈顶部的垃圾收集器:
    000000001dabd8c8 000007feea129a1d [**HelperMethodFrame**: 000000001dabd8c8]
    000000001dabda00 000007fee90cfce8 System.Text.StringBuilder.ExpandByABlock(Int32)
    000000001dabda40 000007fee90cfba4 System.Text.StringBuilder.Append(Char*, Int32)
    ...
    
    EXCEPTION_RECORD:  ffffffffffffffff -- (.exr 0xffffffffffffffff)
    ExceptionAddress: 000007feea129a1d (**clr!WKS::gc_heap**::find_first_object+0x0000000000000092)
       ExceptionCode: c0000005 (Access violation)
      ExceptionFlags: 00000000
    NumberParameters: 2
       Parameter[0]: 0000000000000000
       Parameter[1]: 0000000000003d80
    ...
    
  • CLR 堆栈始终显示不同的点。是否发生崩溃或显示的代码显然无关紧要,例如显示导致异常的 StringBuilder 方法。

  • 更多详情请引用.NET Crash: Managed Heap Corruption calling unmanaged code .

    一步一步来。如果前一个步骤没有帮助,则使用每个下一个步骤。

    步骤 1. 检查代码。

    检查不安全或 native 代码用法的代码:
  • 查看 unsafe 的代码, DllImport声明。
  • 下载.NET Reflector并使用它来分析 PInvoke 的应用程序集.同样,分析应用程序使用的第三方程序集。

  • 如果发现不安全或 native 代码使用,请特别注意这些。在这种情况下堆损坏的最常见原因是缓冲区溢出或参数类型不匹配。确保提供给 native 代码填充的缓冲区足够大,并且传递给 native 代码的所有参数都是预期的类型。

    步骤 2. 检查是否可以捕获此损坏状态异常。

    要处理此类异常,需要修饰包含 catch(Exception) 的方法。声明与 [HandleProcessCorruptedStateExceptions]属性或在 app.config 中应用以下内容文件:
    <configuration>
        <runtime>
            <legacyCorruptedStateExceptionsPolicy enabled="true" />
        </runtime>
    </configuration>
    

    如果异常被成功捕获,您可以记录并检查它。这意味着这不是损坏的堆问题。

    根本无法处理损坏的堆异常:HandleProcessCorruptedStateExceptions doesn't seem to work .

    有关损坏状态异常的更多信息,请参阅 All about Corrupted State Exceptions in .NET4 .

    步骤 3. 实时调试。

    在这一步中,我们在生产环境(或我们可以重现崩溃的地方)中调试崩溃的应用程序。

    Microsoft Windows SDK for Windows 7 and .NET Framework 4 下载适用于 Windows 的调试工具(将下载 Web 安装程序,允许选择安装所需的组件 - 标记所有组件)。它将安装所需调试工具的 32 位和 64 位(如果您的系统是 x64)版本。

    这里需要知道如何将 WinDbg 附加到事件进程,如何获取故障转储并检查它们,如何加载 SOS WinDbg 中的扩展(谷歌了解详细信息)。

    启用调试助手:
  • 启动应用程序验证程序(C:\Program Files\Application Verifier - 使用所需的版本,x86 或 x64,具体取决于您的可执行编译模式),在左侧 Pane 中添加您的可执行文件,并在右侧 Pane 中检查一个节点“Basics/Heaps”。保存更改。
  • 启动全局标志助手(C:\Program Files\Debugging Tools for Windows\gflags.exe - 再次选择正确的版本,x86 或 x64)。启动全局标志后,转到“图像文件”选项卡,然后在顶部的文本框中输入不带任何路径的可执行文件的名称(例如,“MyProgram.exe”)。然后按 Tab 键并设置以下框:
  • 启用堆尾检查
  • 启用堆免费检查
  • 启用堆参数检查
  • 在调用时启用堆验证
  • 免费禁用堆合并
  • 启用页堆
  • 启用堆标记
  • 启用应用程序验证器
  • 调试器(在右侧的文本框中键入已安装 WinDbg 的路径,例如, C:\Program Files\Debugging Tools for Windows (x64)\windbg.exe -g )。

  • 更多详情请引用Heap Corruption, Part 2 .
  • 转到“控制面板/系统和安全/系统”(或右键单击“开始”菜单中的“计算机”并选择“属性”。单击“高级系统设置”,在显示的对话框中,转到“高级”选项卡并单击“环境变量”按钮。在显示的对话框中,添加一个新的系统变量(如果您是系统管理员 - 否则为用户变量 - 在这种情况下您需要注销/登录)所需的变量是“COMPLUS_HeapVerify”值为“1”。更多详细信息可以在堆栈溢出问题 .NET/C#: How to set debugging environment variable COMPLUS_HeapVerify? 中找到。

  • 现在我们准备开始调试。启动应用程序。 WinDbg 应该自动启动它。保持应用程序运行直到它崩溃到 WinDgb,然后检查转储。

    提示 :要快速删除全局标志、应用程序验证程序和调试器附件设置,请删除注册表中的以下项:
    x64 - HKEY_LOCAL_MACHINE\SOFTWARE\Wow6432Node\Microsoft\Windows NT\CurrentVersion\Image File Execution Options\*YourAppName*
    步骤 4. 启用 MDA。

    尝试使用托管调试助手。详细信息在 Stack Overflow 问题 What MDAs are useful to track a heap corruption? 中.

    MDA 必须与 WinDbg 一起使用。我什至将它们与全局标志和应用程序验证器一起使用。

    步骤 5. 启用 GCStress。

    使用 GCStress 是一个极端的选择,因为应用程序变得几乎无法使用,但它仍然是一条路要走。更多详情在GCStress: How to turn on in Windows 7? .

    步骤 6. 为 x86 编译。

    如果您的应用程序当前正在为“任何 CPU”或“x64”平台编译,如果您使用哪个平台没有区别,请尝试为“x86”编译它。我看到这个报道是为了解决某人的问题。

    步骤 7. 禁用并发 GC - 这对我有用

    在线程 Access Violation in .NET 4 Runtime in gc_heap::garbage_collect with no unmanaged modules 中报告了 .NET 4 中的一个已知问题。 .该问题可以通过在 app.config 中禁用并发 GC 来解决。文件:
    <?xml version="1.0"?>
    <configuration>
        <runtime>
            <gcConcurrent enabled="false" />
        </runtime>
    </configuration>
    

    关于c# - 如何调试托管堆中的损坏,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/7064966/

    相关文章:

    C# 文件浏览至 textbox.text only .doc .txt 等

    C# 运算符重载不起作用

    c# - WPF DataGrid 水平滚动条不显示

    wcf - 部署到 IIS : Login failed for user 'IIS APPPOOL\DefaultAppPool' 时出现异常

    c# - 系统.MethodAccessException : Attempt by security transparent method to access security critical method fails on all applications

    c# - 如何通过C#通过OpenXML从Word(.Docx)中提取OLE文件

    c# - 验证使用 Moq 调用的通用方法

    C# PasswordDeriveBytes 混淆

    .net - 如何在完成后跟进 Parallel.ForEach?

    c# - 你能在 XNA 中打开 NumLock 吗?