<?xml version="1.0" encoding="UTF-8"?>
<rss version="2.0">
  <channel>
    <title>민공기</title>
    <link>https://minair.tistory.com/</link>
    <description></description>
    <language>ko</language>
    <pubDate>Thu, 6 Aug 2026 11:38:16 +0900</pubDate>
    <generator>TISTORY</generator>
    <ttl>100</ttl>
    <managingEditor>MINAIR</managingEditor>
    <item>
      <title>[git] conflict 해결하기</title>
      <link>https://minair.tistory.com/136</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;코드를 로컬 VS code로 보면 아래 사진과 같이 conflict가 나는 경우가 있다. 이 경우, 파일에 들어가보면 conflict가 난 부분이 있는데 그 부분을 지워주고 다시 그 파일을 원격에 push해주면 된다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;448&quot; data-origin-height=&quot;414&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/dohbCh/dJMcacaCysx/5K9kIcNkLYZZ9Hq2tbUc61/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/dohbCh/dJMcacaCysx/5K9kIcNkLYZZ9Hq2tbUc61/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/dohbCh/dJMcacaCysx/5K9kIcNkLYZZ9Hq2tbUc61/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FdohbCh%2FdJMcacaCysx%2F5K9kIcNkLYZZ9Hq2tbUc61%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;185&quot; height=&quot;171&quot; data-origin-width=&quot;448&quot; data-origin-height=&quot;414&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;pre id=&quot;code_1766321082938&quot; class=&quot;bash&quot; data-ke-language=&quot;bash&quot; data-ke-type=&quot;codeblock&quot;&gt;&lt;code&gt;# evaluate.py에서 conflict난 부분 수정
git add evaluate.py
git commit -m &quot;fix conflict&quot;
git push&lt;/code&gt;&lt;/pre&gt;</description>
      <category> ️ 에러 해결 기록</category>
      <author>MINAIR</author>
      <guid isPermaLink="true">https://minair.tistory.com/136</guid>
      <comments>https://minair.tistory.com/136#entry136comment</comments>
      <pubDate>Sun, 21 Dec 2025 21:44:46 +0900</pubDate>
    </item>
    <item>
      <title>[git] 로컬과 원격 merge 후 push하기</title>
      <link>https://minair.tistory.com/135</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;다른 사람과 함께 깃허브를 쓰다 보니 항상 merge 에러가 나서 고생했던 기억 ...&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이 기회에 명확하게 정리해보려고 한다!!&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;먼저, 내가 기존에 로컬 -&amp;gt; 원격 push하는 방법은 아래와 같았다.&lt;/p&gt;
&lt;pre id=&quot;code_1766320023965&quot; class=&quot;bash&quot; data-ke-language=&quot;bash&quot; data-ke-type=&quot;codeblock&quot;&gt;&lt;code&gt;git add .
git commit -m &quot;commit_message&quot;
git push&lt;/code&gt;&lt;/pre&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;잘 될 때도 있었지만, 로컬과 원격의 내용이 다르다며 push가 실패하는 경우도 있었다. 클로드에게 물어보니 ...&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존의 방법이 잘 되는 경우는, 완전히 새로운 파일/폴더를 push하는 경우다.&amp;nbsp;&lt;/p&gt;
&lt;pre id=&quot;code_1766320114215&quot; class=&quot;bash&quot; data-ke-language=&quot;bash&quot; data-ke-type=&quot;codeblock&quot;&gt;&lt;code&gt;원격: A &amp;rarr; B &amp;rarr; C
로컬: A &amp;rarr; B &amp;rarr; C &amp;rarr; D (내가 추가)&lt;/code&gt;&lt;/pre&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존의 방법이 실패하는 경우는, 원격에서 또다른 사용자가 push한 내용을 내가 덮어씌울려고 하는 경우다.&lt;/p&gt;
&lt;pre id=&quot;code_1766320141564&quot; class=&quot;bash&quot; data-ke-language=&quot;bash&quot; data-ke-type=&quot;codeblock&quot;&gt;&lt;code&gt;원격: A &amp;rarr; B &amp;rarr; C &amp;rarr; E (다른 사람이 추가)
로컬: A &amp;rarr; B &amp;rarr; C &amp;rarr; D (내가 추가)&lt;/code&gt;&lt;/pre&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;따라서, 안전하게 변경사항을 push하기 위해서는 항상 원격의 내용을 로컬에 pull한 다음 push를 하는 것을 권장한다고 한다. 그러나, 로컬의 내용 역시 안전하게 보존하고 싶은 경우가 있기 때문에, 최종적으로는 아래와 같은 단계를 거치면 에러 없이 merge 후 변경사항을 push할 수 있다.&lt;/p&gt;
&lt;pre id=&quot;code_1766320518345&quot; class=&quot;bash&quot; data-ke-language=&quot;bash&quot; data-ke-type=&quot;codeblock&quot;&gt;&lt;code&gt;git stash # 로컬의 내용을 저장 
git pull origin mcq --no-rebase # 로컬과 원격의 내용을 merge (병합)
# -------------------
commit 메시지를 작성하는 새로운 창이 뜸. 
i (convert to insert mode) -&amp;gt; write commit message -&amp;gt; esc -&amp;gt; :wq
# -------------------
git stash pop # (충돌이 없으면) stash한 내용 복원
git push&lt;/code&gt;&lt;/pre&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;</description>
      <category> ️ 에러 해결 기록</category>
      <author>MINAIR</author>
      <guid isPermaLink="true">https://minair.tistory.com/135</guid>
      <comments>https://minair.tistory.com/135#entry135comment</comments>
      <pubDate>Sun, 21 Dec 2025 21:35:26 +0900</pubDate>
    </item>
    <item>
      <title>LONGHALQA: LONG-CONTEXT HALLUCINATIONEVALUATION FOR MULTIMODAL LARGE LANGUAGEMODELS (Preprint)</title>
      <link>https://minair.tistory.com/132</link>
      <description>&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;Paper&lt;/b&gt;&lt;/h3&gt;
&lt;hr contenteditable=&quot;false&quot; data-ke-type=&quot;horizontalRule&quot; data-ke-style=&quot;style5&quot; /&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/pdf/2410.09962&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/pdf/2410.09962&lt;/a&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 style=&quot;color: #000000; text-align: start;&quot; data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;Introduction&lt;/b&gt;&lt;/h3&gt;
&lt;hr contenteditable=&quot;false&quot; data-ke-type=&quot;horizontalRule&quot; data-ke-style=&quot;style5&quot; /&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;benchmark의 종류&amp;nbsp;&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;discriminative evaluations: Y/N, multiple choices (e.g., object가 image에 존재하는가?)&lt;/li&gt;
&lt;li&gt;generative evaluations: MLLM의 response를 LLM evaluator로 hallucinate되었는지 아닌지 평가함&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;기존 benchmark &amp;amp; evaluation의 한계&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;too simple to tell much on the cause of hallucination and to be applied to real-world scenario&lt;/li&gt;
&lt;li&gt;off-the-shelf object annotation을 benchmark에 그대로 사용하기 때문에 limited variability&lt;/li&gt;
&lt;li&gt;LLM evaluator을 사용하면 computationally intensive &amp;amp; unstable함&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;본 논문의 approach&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;2개의 MCQ (Multiple-Choice Question) 태스크를 이용
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;hallucination discriminative: text가 hallucination을 포함하고 있는지 아닌지 (yes/no), 그 이유가 무엇인지를 MCQ로 고르게 함&lt;/li&gt;
&lt;li&gt;hallucination completion: prefix에 대한 continuation (yes/no와 그 이유)을 MCQ로 고르게 함&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;long and complex context를 이용해 real-world and practical scenario에 대한 평가를 할 수 있음&lt;/li&gt;
&lt;li&gt;LongHallGen: GPT4v를 이용해 hallucination data을 생성하고 이를 MCQ format으로 구축하는 automated benchmark construction pipeline을 제시&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1668&quot; data-origin-height=&quot;1554&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/YhdLC/btsP1rA9kbG/ju69PIiTAf39aUSqZltvm0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/YhdLC/btsP1rA9kbG/ju69PIiTAf39aUSqZltvm0/img.png&quot; data-alt=&quot;위: existing / 아래: ours&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/YhdLC/btsP1rA9kbG/ju69PIiTAf39aUSqZltvm0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FYhdLC%2FbtsP1rA9kbG%2Fju69PIiTAf39aUSqZltvm0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;644&quot; height=&quot;600&quot; data-origin-width=&quot;1668&quot; data-origin-height=&quot;1554&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;위: existing / 아래: ours&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;/p&gt;
&lt;h3 style=&quot;color: #000000; text-align: start;&quot; data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;LongHalQA: Long-Context Hallucination Benchmark&lt;/b&gt;&lt;/h3&gt;
&lt;hr contenteditable=&quot;false&quot; data-ke-type=&quot;horizontalRule&quot; data-ke-style=&quot;style5&quot; /&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Hallucination Discrimination&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;yes로 시작하는 답변: text와 image가 match하다는 의견과 그 근거 제시&lt;/li&gt;
&lt;li&gt;no로 시작하는 답변: text와 image가 unmatch하다는 의견과 그 근거 제시&lt;/li&gt;
&lt;li&gt;단순히 모델이 object existence를 아는지 모르는지가 아니라 모델이 text와 image의 상황에 대한 understanding을 평가&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Hallucination Completion&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;원래 generative evaluation은 LLM evaluator를 이용해 느리고 비쌌음. 이를 MCQ 형태로 바꾼 것.&lt;/li&gt;
&lt;li&gt;image + related incomplete description / conversation을 준 뒤, 보기를 prefix에 대한 continuation으로 한 다음 모델에게 고르도록 함. 3개는 hallucinatory choices, 1개는 correct choice&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Data Format&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;object-level description: object, attribute, state, relation with other objects에 대한 묘사 (discriminative)&lt;/li&gt;
&lt;li&gt;image-level description: main contents, more details of an image (e.g., object, background, weather)을 묘사 (discriminative, completion)&lt;/li&gt;
&lt;li&gt;multi-round conversation: human user와 assistant가 대화한 내용을 묘사 (discriminative, completion)&amp;nbsp;&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Types of Hallucination&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;LongHalQA은 12가지 종류의 hallucination을 평가함&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;2440&quot; data-origin-height=&quot;1276&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/betj2D/btsP1sNx3Mn/ONRKAMKuZs7c1G53W0GDzK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/betj2D/btsP1sNx3Mn/ONRKAMKuZs7c1G53W0GDzK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/betj2D/btsP1sNx3Mn/ONRKAMKuZs7c1G53W0GDzK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fbetj2D%2FbtsP1sNx3Mn%2FONRKAMKuZs7c1G53W0GDzK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;2440&quot; height=&quot;1276&quot; data-origin-width=&quot;2440&quot; data-origin-height=&quot;1276&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Complexity and Length of Text in LongHalQA&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;average words object, image, conversation: 14, 130, 189 (&amp;lt;-&amp;gt; exisitng benchmarks: 80 words)&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Evaluation methods and Metrics&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;binary answers: acc, precision, yes ratio&lt;/li&gt;
&lt;li&gt;multiple-choice setting: (mc-) acc (randomly shuffled the order of the four options for fairness) =&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 style=&quot;color: #000000; text-align: start;&quot; data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;LongHallGen: Automated Long-context Hallucination Data Generation&lt;/b&gt;&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;1. Image Collection and Filtering&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;image를 수집해야 함 -&amp;gt; too simple / rare한 scene은 걸러야 함&lt;/li&gt;
&lt;li&gt;VisualGenome, Objects365 이미지셋에서 GroundingDINO 모델을 이용해 이미지 필터링&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;2. Positive Data Generation&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;GPT4V한테 image를 입력으로 주어 long-context text 생성하라고 함&lt;/li&gt;
&lt;li&gt;근데 생성된 text에서 hallucination이 발생할 수 있음&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;3. Hallucination Check&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;GPT4V가 생성한 long context text를 GPT4V가 self-check함&lt;/li&gt;
&lt;li&gt;text로부터 object annotation 추출, GroundingDINO한테 image-annotation이 잘 맞는지 확인하라고 함 -&amp;gt; 결과를 다시 GPT4V한테 입력으로 주어 further checking&lt;/li&gt;
&lt;li&gt;마지막으로, 사람이 long-context text 확인&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;4. Hallucination-Explanation Pair Generation&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;text에 hallucination이 없는 경우: GPT4V한테 hallucination type 중에서 하나의 에러를 데이터에 생성하라고 함&lt;/li&gt;
&lt;li&gt;text에 hallucination이 있는 경우: GPT4V한테 데이터에 하나의 에러만 남기도록 수정하라고 함&lt;/li&gt;
&lt;li&gt;너무 복잡해지는 것을 막기 위해 text 당 1개씩의 hallucination만 있도록 함&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;5. Question and Answer Generation&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;generated HE pair를 이용해 GPT4V한테 MCQ 형태로 문제를 만들라고 함&lt;/li&gt;
&lt;li&gt;discriminative: 질문: Does the following {Hallucinated Data in HE pair} match the image content? / 정답: 4지선다&lt;/li&gt;
&lt;li&gt;completion: 질문: Complete the following {Hallucinated Data in HE pair} / 정답: 4지선다&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;Experiments&lt;/b&gt;&lt;/h3&gt;
&lt;hr contenteditable=&quot;false&quot; data-ke-type=&quot;horizontalRule&quot; data-ke-style=&quot;style5&quot; /&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;overall experiments&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;Qwen2-VL-72B가 hallucination completion task에 대해 best performance를 보임&lt;/li&gt;
&lt;li&gt;MiniCPM-V2, Qwen2-VL-2B의 성능이 잘 나온 것으로 보아 reinforcement learning으로 hallucination 줄이는 훈련의 효과를 보임&lt;/li&gt;
&lt;li&gt;image의 resolution (해상도)가 좋아야 hallucination을 완화할 수 있음&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;experiments on hallucination discrimination&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;binary setting: 대부분의 LLM이 long-context에 취약함&lt;/li&gt;
&lt;li&gt;multiple-choice setting: binary setting에 비해 성능이 좋음. 이는 binary setting과 달리 보기에 detailed explanation이 있기 때문에 모델이 상황을 더 잘 이해하여 보기를 선택할 수 있기 때문으로 추측됨.&amp;nbsp;&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;experiments on hallucination completion&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;high resolution image, multi-modal RLHF training이 중요함&lt;/li&gt;
&lt;/ul&gt;</description>
      <category>  VLM</category>
      <author>MINAIR</author>
      <guid isPermaLink="true">https://minair.tistory.com/132</guid>
      <comments>https://minair.tistory.com/132#entry132comment</comments>
      <pubDate>Fri, 22 Aug 2025 17:27:13 +0900</pubDate>
    </item>
    <item>
      <title>Unified Hallucination Detection for Multimodal Large Language Models (ACL 2024 main)</title>
      <link>https://minair.tistory.com/131</link>
      <description>&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;Paper&lt;/b&gt;&lt;/h3&gt;
&lt;hr contenteditable=&quot;false&quot; data-ke-type=&quot;horizontalRule&quot; data-ke-style=&quot;style5&quot; /&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2402.03190&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2402.03190&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1755701689133&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;Unified Hallucination Detection for Multimodal Large Language Models&quot; data-og-description=&quot;Despite significant strides in multimodal tasks, Multimodal Large Language Models (MLLMs) are plagued by the critical issue of hallucination. The reliable detection of such hallucinations in MLLMs has, therefore, become a vital aspect of model evaluation a&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2402.03190&quot; data-og-url=&quot;https://arxiv.org/abs/2402.03190v4&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/cwVO9V/hyZC23XXOV/xXcfFVcm6OUPfvinCGbPS0/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/7GQJw/hyZyfRq4qE/ouPkhHBkL4Rl2Nup01P2Lk/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2402.03190&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2402.03190&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/cwVO9V/hyZC23XXOV/xXcfFVcm6OUPfvinCGbPS0/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/7GQJw/hyZyfRq4qE/ouPkhHBkL4Rl2Nup01P2Lk/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Unified Hallucination Detection for Multimodal Large Language Models&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Despite significant strides in multimodal tasks, Multimodal Large Language Models (MLLMs) are plagued by the critical issue of hallucination. The reliable detection of such hallucinations in MLLMs has, therefore, become a vital aspect of model evaluation a&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 style=&quot;color: #000000; text-align: start;&quot; data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;Introduction&lt;/b&gt;&lt;/h3&gt;
&lt;hr contenteditable=&quot;false&quot; data-ke-type=&quot;horizontalRule&quot; data-ke-style=&quot;style5&quot; /&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;existing hallucination detection approach의 문제점&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;task singularity: 특정 태스크만 다룸 (e.g., image captioning만 다루고 T2I는 무시)&amp;nbsp;&lt;/li&gt;
&lt;li&gt;limited hallucination categories: object level만 다룸. scene-text, factual level은 무시&lt;/li&gt;
&lt;li&gt;incomplete granularity: response의 전체를 보기보다 response의 각 claim을 쪼깬 평가가 필요함&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 style=&quot;color: #000000; text-align: start;&quot; data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;Construction of MHaluBench&lt;/b&gt;&lt;/h3&gt;
&lt;hr contenteditable=&quot;false&quot; data-ke-type=&quot;horizontalRule&quot; data-ke-style=&quot;style5&quot; /&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;hallucinatory example collection&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;I2T generation: MSCOCO, TextVQA images를 mPLUG-Owl, LLaVA, MiniGPT-4에게 입력으로 주어 caption text를 생성하도록 함&lt;/li&gt;
&lt;li&gt;T2I generation: DrawBench, T2I-CompBench의 caption을 ChatGPT에게 입력으로 주어 더 구체적인 정보를 담도록 refine함. refined caption을 DALL-E2와 DALL-E3에게 입력으로 주어 caption에 맞는 image를 생성하도록 함&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;segment and claim extraction&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;ChatGPT를 이용해 I2T의 경우 text output을, T2I의 경우 user queries를 segment/claim으로 쪼갬&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;human annotation and agreement&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;본 벤치마크의 annotation은 image-text가 서로에게 혹은 world knowledge와 충돌하는지 아닌지의 여부임. 따라서 hallucinatory 또는 non-hallucinatory로 라벨링됨 (annotate됨)&amp;nbsp;&lt;/li&gt;
&lt;li&gt;I2T의 경우, given image + 쪼개진 generated claims가, T2I의 경우, 쪼개진 claims + generated image가 human annotators에게 주어지고, human annotators가 각각 쪼개진 claims가 hallucinate되었는지 아닌지를 판단함 (3명의 annotator끼리 cross-validation을 진행했을 때, 그 척도인 Fleiss's Kappa = 0.82 정도로 높은 agreement 정도를 보임)&lt;/li&gt;
&lt;li&gt;전체 response 중 하나의 claim이라도 hallucinate되었으면 전체 response가 hallucinate되었다고 라벨링됨&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;946&quot; data-origin-height=&quot;1140&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/AQNk7/btsP0iQxejv/7xgmP1Jesf5eYFmj2kPBq1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/AQNk7/btsP0iQxejv/7xgmP1Jesf5eYFmj2kPBq1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/AQNk7/btsP0iQxejv/7xgmP1Jesf5eYFmj2kPBq1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FAQNk7%2FbtsP0iQxejv%2F7xgmP1Jesf5eYFmj2kPBq1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;595&quot; height=&quot;717&quot; data-origin-width=&quot;946&quot; data-origin-height=&quot;1140&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;h3 style=&quot;color: #000000; text-align: start;&quot; data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;UNIHD: Unified Hallucination Detection Framework for MLLMs&lt;/b&gt;&lt;/h3&gt;
&lt;hr contenteditable=&quot;false&quot; data-ke-type=&quot;horizontalRule&quot; data-ke-style=&quot;style5&quot; /&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;color: #ef6f53;&quot;&gt;&lt;b&gt;MHaluBench는 prompt + image + caption + human annotation (hallucinate or not)으로 이루어진 벤치마크임.&amp;nbsp;&lt;/b&gt;&lt;/span&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;color: #ef6f53;&quot;&gt;&lt;b&gt;UNIHD는 MHaluBench를 이용해 모델의 hallucination를 detect하는 framework!! 즉 human annotation이랑 align하는 hallucination detection 결과를 내야 함. (detector powered by GPT-4V or Gemini) I2T의 경우엔 prompt + image가 입력으로 들어가고 GPT-4V or Gemini를 이용해 caption을 claims로 쪼갠 뒤 tool assignment, evidence generation을 통해 hallucinate인지 아닌지 detect. T2I의 경우엔 prompt + caption이 입력으로 들어가고 DALL-E를 이용해 image를 생성한 뒤, caption을 claims으로 쪼갠 뒤 tool assignment, evidence generation을 통해 hallucination인지 아닌지 detect.&amp;nbsp;&lt;/b&gt;&lt;/span&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;1. Essential Claim Extraction&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;GPT-4V or Gemini로 하여금 모델의 generation (I2T: text output, T2I: user query)를 claim으로 쪼갬&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;2. Autonomous Tool Selection Via Query Formulation&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;쪼개진 각 claim이 이를 평가/검증할 수 있는 적절한 tool에 매칭되어야 함&lt;/li&gt;
&lt;li&gt;GPT-4V/Gemini에게 각 claim에 적절한 평가/검증 query를 생성하라고 함 (e.g., claim1은 &lt;b&gt;attribute&lt;/b&gt;-oriented question과 &lt;b&gt;object&lt;/b&gt;-oriented inquiry를 통한 검증이 필요함. scene-text와 fact에 대한 검증은 필요 x)&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;3. Parallel Tool Execution&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;각 tool을 parallel하게 실행시켜서 각 claim을 검증함&lt;/li&gt;
&lt;li&gt;object-oriented tool: open-set object detection model grounding DINO를 사용해 image의 위치 정보를 반환&lt;/li&gt;
&lt;li&gt;attribute-oriented tool: GPT4V or Gemini를 이용해 step 2에서 생성된 query에 대한 답 반환&lt;/li&gt;
&lt;li&gt;scene-text-oriented tool: MAERec를 이용해 scene-text의 위치 정보를 반환&amp;nbsp;&lt;/li&gt;
&lt;li&gt;fact-oriented tool: Serper Google Search API를 이용해 fact 체크 결과를 반환&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;4. Hallucination Verification with Rationales&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;image, claim list, evidence from tool을 GPT-4V or Gemini에게 comprehensive prompt로 주어 hallucination인지 아닌지 판단하도록 함&lt;/li&gt;
&lt;li&gt;hallucination type: object, attribute, scene-text, fact&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1884&quot; data-origin-height=&quot;1284&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cFqScU/btsP1sxZHQi/esGZJIarNkAlfmERzUqTTk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cFqScU/btsP1sxZHQi/esGZJIarNkAlfmERzUqTTk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cFqScU/btsP1sxZHQi/esGZJIarNkAlfmERzUqTTk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcFqScU%2FbtsP1sxZHQi%2FesGZJIarNkAlfmERzUqTTk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1884&quot; height=&quot;1284&quot; data-origin-width=&quot;1884&quot; data-origin-height=&quot;1284&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;</description>
      <category>  VLM</category>
      <author>MINAIR</author>
      <guid isPermaLink="true">https://minair.tistory.com/131</guid>
      <comments>https://minair.tistory.com/131#entry131comment</comments>
      <pubDate>Thu, 21 Aug 2025 00:39:09 +0900</pubDate>
    </item>
    <item>
      <title>Visual Instruction Tuning (LLaVA)</title>
      <link>https://minair.tistory.com/130</link>
      <description>&lt;h3 style=&quot;color: #000000; text-align: start;&quot; data-ke-size=&quot;size23&quot;&gt;&lt;span style=&quot;font-family: 'Noto Sans Demilight', 'Noto Sans KR';&quot;&gt;&lt;b&gt;Paper&lt;/b&gt;&lt;/span&gt;&lt;/h3&gt;
&lt;hr contenteditable=&quot;false&quot; data-ke-type=&quot;horizontalRule&quot; data-ke-style=&quot;style5&quot; /&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2304.08485&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2304.08485&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1755606570225&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;Visual Instruction Tuning&quot; data-og-description=&quot;Instruction tuning large language models (LLMs) using machine-generated instruction-following data has improved zero-shot capabilities on new tasks, but the idea is less explored in the multimodal field. In this paper, we present the first attempt to use l&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2304.08485&quot; data-og-url=&quot;https://arxiv.org/abs/2304.08485v2&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/iwH6I/hyZzLvvDZg/CMPsVtG4UYB6bK7sp6zGzk/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/Th60w/hyZzAgqPeS/QLGxjiRg9j8bFiokSChjOk/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2304.08485&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2304.08485&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/iwH6I/hyZzLvvDZg/CMPsVtG4UYB6bK7sp6zGzk/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/Th60w/hyZzAgqPeS/QLGxjiRg9j8bFiokSChjOk/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Visual Instruction Tuning&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Instruction tuning large language models (LLMs) using machine-generated instruction-following data has improved zero-shot capabilities on new tasks, but the idea is less explored in the multimodal field. In this paper, we present the first attempt to use l&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 style=&quot;color: #000000; text-align: start;&quot; data-ke-size=&quot;size23&quot;&gt;&lt;span style=&quot;font-family: 'Noto Sans Demilight', 'Noto Sans KR';&quot;&gt;&lt;b&gt;Introduction&lt;/b&gt;&lt;/span&gt;&lt;/h3&gt;
&lt;hr contenteditable=&quot;false&quot; data-ke-type=&quot;horizontalRule&quot; data-ke-style=&quot;style5&quot; /&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;font-family: 'Noto Sans Demilight', 'Noto Sans KR';&quot;&gt;배경&lt;/span&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;언어가 이미지를 설명하는 것에서 더 나아가, user instruction을 따를 수 있는 inter-activity와 adaptability가 있어야 함&lt;/li&gt;
&lt;li&gt;NLP 분야에서 LLM instruction으로 튜닝하는 것이 모델의 zero-shot capability 향상에 기여 -&amp;gt; 동일한 concept을 VLM에도 적용하고자 함&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;contribution&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;multimodal instruction-following data: vision-language instruction data를 수집&lt;/li&gt;
&lt;li&gt;large multimodal models: 수집한 데이터를 이용해 CLIP (vision encoder) + Vicuna (text decoder)를 fine-tuning해 새로운 LVLM을 만듦&lt;/li&gt;
&lt;li&gt;multimodal instruction-following benchmark: LLaVA-Bench를 구축&lt;/li&gt;
&lt;li&gt;open-source ⭐️&amp;nbsp;&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 style=&quot;color: #000000; text-align: start;&quot; data-ke-size=&quot;size23&quot;&gt;&lt;span style=&quot;font-family: 'Noto Sans Demilight', 'Noto Sans KR';&quot;&gt;&lt;b&gt;GPT-assisted Visual Instruction Data Generation&lt;/b&gt;&lt;/span&gt;&lt;/h3&gt;
&lt;hr contenteditable=&quot;false&quot; data-ke-type=&quot;horizontalRule&quot; data-ke-style=&quot;style5&quot; /&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;처음 시도&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;widely existing image-caption pair 데이터를 이용해 ChatGPT/GPT-4로부터 multimodal instruction-following data 수집&lt;/li&gt;
&lt;li&gt;image Xv, caption Xc에 대해 GPT-4에게 Xv에 대한 Xc의 생성을 지시하는 instruction Xq를 생성하도록 함&lt;/li&gt;
&lt;li&gt;instruction-following data format: Human: Xq Xv &amp;lt;STOP&amp;gt; Assistant: Xc &amp;lt;STOP&amp;gt;&amp;nbsp;&lt;/li&gt;
&lt;li&gt;그러나, 이렇게 생성된 data는 간단하지만 이렇게 되면 단순히 caption을 생성하는 instruction으로 튜닝되는 것이기 때문에, 데이터의 diveristy &amp;amp; in-depth reasoning이 부족함&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이 문제를 해결하기 위해 text-only GPT를 이용함&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;1) caption Xc, 2) image에서 object의 bounding boxes 좌표값을 입력으로 주어줌 -&amp;gt; image를 LLM-recognizable sequence로 encoding할 수 있음 (GPT를 prompt할 때, image는 주어지지 않고 오직 caption과 boxes만 주어짐)&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1692&quot; data-origin-height=&quot;562&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/binA1M/btsPZ2swwCe/upqX9Rs1UqbVyxIJQkiA0K/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/binA1M/btsPZ2swwCe/upqX9Rs1UqbVyxIJQkiA0K/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/binA1M/btsPZ2swwCe/upqX9Rs1UqbVyxIJQkiA0K/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbinA1M%2FbtsPZ2swwCe%2FupqX9Rs1UqbVyxIJQkiA0K%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;631&quot; height=&quot;210&quot; data-origin-width=&quot;1692&quot; data-origin-height=&quot;562&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;COCO images를 이용해 3가지 타입의 instruction-following data를 구축 (몇 개는 사람이 미리 만들어서 seed example로 사용해 GPT의 in-context 능력을 이용해 data를 생성)&amp;nbsp;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;conversation&lt;/li&gt;
&lt;li&gt;detailed description&lt;/li&gt;
&lt;li&gt;complex reasoning&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 style=&quot;color: #000000; text-align: start;&quot; data-ke-size=&quot;size23&quot;&gt;&amp;nbsp;&lt;/h3&gt;
&lt;h3 style=&quot;color: #000000; text-align: start;&quot; data-ke-size=&quot;size23&quot;&gt;&lt;span style=&quot;font-family: 'Noto Sans Demilight', 'Noto Sans KR';&quot;&gt;&lt;b&gt;Visual Instruction Tuning&lt;/b&gt;&lt;/span&gt;&lt;/h3&gt;
&lt;hr contenteditable=&quot;false&quot; data-ke-type=&quot;horizontalRule&quot; data-ke-style=&quot;style5&quot; /&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;CLIP (vision encoder) + Vicuna (language model which has best instruction following capabilities among other models)&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;684&quot; data-origin-height=&quot;94&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bj0UhV/btsPYBvN0Hb/2RFB18drfA78oRHL8tqQQk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bj0UhV/btsPYBvN0Hb/2RFB18drfA78oRHL8tqQQk/img.png&quot; data-alt=&quot;image를 text와 같은 차원으로 투영시킴 (trainable W 이용)&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bj0UhV/btsPYBvN0Hb/2RFB18drfA78oRHL8tqQQk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fbj0UhV%2FbtsPYBvN0Hb%2F2RFB18drfA78oRHL8tqQQk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;277&quot; height=&quot;38&quot; data-origin-width=&quot;684&quot; data-origin-height=&quot;94&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;image를 text와 같은 차원으로 투영시킴 (trainable W 이용)&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1462&quot; data-origin-height=&quot;562&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bx7zJW/btsPXyTJJsQ/O5sCRCdWtmnDwcXxPD9Uz0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bx7zJW/btsPXyTJJsQ/O5sCRCdWtmnDwcXxPD9Uz0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bx7zJW/btsPXyTJJsQ/O5sCRCdWtmnDwcXxPD9Uz0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fbx7zJW%2FbtsPXyTJJsQ%2FO5sCRCdWtmnDwcXxPD9Uz0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;639&quot; height=&quot;246&quot; data-origin-width=&quot;1462&quot; data-origin-height=&quot;562&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;auto-regressive training objective를 이용해 모델이 튜닝됨. 아래는 튜닝될 때 모델의 입력 시퀀스.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1990&quot; data-origin-height=&quot;590&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/dllL91/btsPXWtjVOR/k6TjkoTSl2YZYKIOf7RbKK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/dllL91/btsPXWtjVOR/k6TjkoTSl2YZYKIOf7RbKK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/dllL91/btsPXWtjVOR/k6TjkoTSl2YZYKIOf7RbKK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FdllL91%2FbtsPXWtjVOR%2Fk6TjkoTSl2YZYKIOf7RbKK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1990&quot; height=&quot;590&quot; data-origin-width=&quot;1990&quot; data-origin-height=&quot;590&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;color: #ee2323;&quot;&gt;&lt;b&gt;&lt;span style=&quot;font-family: 'Noto Sans Demilight', 'Noto Sans KR';&quot;&gt;훈련 단계&lt;/span&gt;&lt;/b&gt;&lt;/span&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;step 1) pre-training for feature alignment: 먼저, visual information이 text space로 align될 수 있도록 하기 위해서 훈련 과정이 필요함. Xv에 대해 Xc를 생성할 수 있는 question Xq를 생성한 뒤, 처음 시도처럼 &amp;lt;Xq, Xv&amp;gt;가 입력으로 주어지면 Xc를 gt 삼아 모델이 응답을 생성할 수 있도록 훈련됨. 이때, LLM과 vision encoder는 frozen하고 projection parameters W만 훈련시켜 image features를 pre-trained LLM word embedding space로 잘 투영될 수 있도록 함. (e.g., Xq: &quot;Describe the image precisely&quot;)&lt;/li&gt;
&lt;li&gt;step 2) fine-tuning end-to-end: LLM과 projection parameters W만 훈련시킴.
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;multimodal chatbot: 위에서 구축한 3가지 타입의 데이터를 이용해 튜닝. conversation은 multi-turn, detailed description과 complex reasoning은 single-turn으로 튜닝함&lt;/li&gt;
&lt;li&gt;scienceQA: context (caption, bounding boxes), Xq (generated by GPT)를 입력으로 했을 때 Xa (generated by GPT)를 gt로 삼아 모델이 응답을 생성할 수 있도록 튜닝함 -&amp;gt; SoTA 달성!!&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 style=&quot;color: #000000; text-align: start;&quot; data-ke-size=&quot;size23&quot;&gt;&lt;span style=&quot;font-family: 'Noto Sans Demilight', 'Noto Sans KR';&quot;&gt;&lt;b&gt;Experiments&lt;/b&gt;&lt;/span&gt;&lt;/h3&gt;
&lt;hr contenteditable=&quot;false&quot; data-ke-type=&quot;horizontalRule&quot; data-ke-style=&quot;style5&quot; /&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;font-family: AppleSDGothicNeo-Regular, 'Malgun Gothic', '맑은 고딕', dotum, 돋움, sans-serif;&quot;&gt;multimodal chatabot&lt;/span&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;llava는 다른 모델 (GPT-4, BLIP-2, OpenFlamingo)와 비교했을 때, 단순히 image를 묘사하는 것뿐 아니라 chatbot으로써 우수한 성능을 보임&lt;/li&gt;
&lt;li&gt;또한, llava는 out-of-trained domain인 image에 대해서도 scene을 잘 이해하고 있는 모습을 보임&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;LLaVA-Bench (COCO)&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;30개의 각 COCO image에 대해 3가지 타입의 question-answer (conversation, detailed description, complex reasoning)을 생성해 총 90개의 데이터를 생성함&lt;/li&gt;
&lt;li&gt;question, image를 모델의 prompt로 주고, answer를 생성하도록 해서 평가함&lt;/li&gt;
&lt;li&gt;이 벤치마크를 통해 모델의 instruction-following behavior를 평가할 수 있음&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;LLaVA-Bench (In-the-wild)&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;LLaVA의 일반화 능력을 평가하기 위해 여러 도메인에서 24개의 image를 수집하고 60개의 데이터를 만듦. instruction-tuning의 효과 덕분에 벤치마크에 대해 LLaVA는 BLIP-2, OpenFlamingo보다 훨씬 좋은 성능을 보임.&amp;nbsp;&lt;/li&gt;
&lt;li&gt;그러나, 문제가 너무 어렵다는 한계가 있음 (wide general knowledge coverage 요구, fine-grained semantic understanding 능력 요구)&amp;nbsp;&lt;/li&gt;
&lt;/ul&gt;</description>
      <category>  VLM</category>
      <author>MINAIR</author>
      <guid isPermaLink="true">https://minair.tistory.com/130</guid>
      <comments>https://minair.tistory.com/130#entry130comment</comments>
      <pubDate>Tue, 19 Aug 2025 23:12:17 +0900</pubDate>
    </item>
    <item>
      <title>Evaluating Object Hallucination in LVLMs (POPE)</title>
      <link>https://minair.tistory.com/129</link>
      <description>&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;span style=&quot;font-family: 'Noto Sans Demilight', 'Noto Sans KR';&quot;&gt;&lt;b&gt;Paper&lt;/b&gt;&lt;/span&gt;&lt;/h3&gt;
&lt;hr contenteditable=&quot;false&quot; data-ke-type=&quot;horizontalRule&quot; data-ke-style=&quot;style5&quot; /&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2305.10355&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2305.10355&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1755592233369&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;Evaluating Object Hallucination in Large Vision-Language Models&quot; data-og-description=&quot;Inspired by the superior language abilities of large language models (LLM), large vision-language models (LVLM) have been recently explored by integrating powerful LLMs for improving the performance on complex multimodal tasks. Despite the promising progre&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2305.10355&quot; data-og-url=&quot;https://arxiv.org/abs/2305.10355v3&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/bkgMMd/hyZypl3Kuv/QYJVPt52wuNlcizEqbAWek/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/dhcn7l/hyZzEJOFRi/kXA3APqhkb8HHrl0KMeA1K/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2305.10355&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2305.10355&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/bkgMMd/hyZypl3Kuv/QYJVPt52wuNlcizEqbAWek/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/dhcn7l/hyZzEJOFRi/kXA3APqhkb8HHrl0KMeA1K/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Evaluating Object Hallucination in Large Vision-Language Models&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Inspired by the superior language abilities of large language models (LLM), large vision-language models (LVLM) have been recently explored by integrating powerful LLMs for improving the performance on complex multimodal tasks. Despite the promising progre&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;h3 style=&quot;color: #000000; text-align: start;&quot; data-ke-size=&quot;size23&quot;&gt;&amp;nbsp;&lt;/h3&gt;
&lt;h3 style=&quot;color: #000000; text-align: start;&quot; data-ke-size=&quot;size23&quot;&gt;&lt;span style=&quot;font-family: 'Noto Sans Demilight', 'Noto Sans KR';&quot;&gt;&lt;b&gt;Introduction&lt;/b&gt;&lt;/span&gt;&lt;/h3&gt;
&lt;hr contenteditable=&quot;false&quot; data-ke-type=&quot;horizontalRule&quot; data-ke-style=&quot;style5&quot; /&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;배경&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;text encoder 대신 powerful LLM을 활용 &amp;amp; vision-language pre-train 후 visual instruction tuning을 통해 LVLM 만듦 -&amp;gt; 성능 향상&lt;/li&gt;
&lt;li&gt;object hallucination이란 given image에 있는 ground-truth object와 inconsistent한 내용을 생성하는 현상
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;coarse-grained (object 자체)와 fine-grained (object의 attribute, characteristic 등)의 수준으로 구분 가능&lt;/li&gt;
&lt;li&gt;본 논문은 coarse-grained에 초점을 맞춤&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;본 논문의 목적은 LVLM에 object hallucination 발생하고 있는지 평가하는 것&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;contribution&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;대표적인 LVLM이 hallucination에 취약하다는 사실을 밝힘&lt;/li&gt;
&lt;li&gt;왜 취약한 지 원인을 조사&amp;nbsp;&lt;/li&gt;
&lt;li&gt;object hallucination evaluation approach, POPE를 제시함&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 style=&quot;color: #000000; text-align: start;&quot; data-ke-size=&quot;size23&quot;&gt;&lt;span style=&quot;font-family: 'Noto Sans Demilight', 'Noto Sans KR';&quot;&gt;&lt;b&gt;Object hallucination in LVLMs&lt;/b&gt;&lt;/span&gt;&lt;/h3&gt;
&lt;hr contenteditable=&quot;false&quot; data-ke-type=&quot;horizontalRule&quot; data-ke-style=&quot;style5&quot; /&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;preliminary experiments&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;여러 LVLM + MSCOCO dataset을 CHAIR metric으로 평가한 결과 (값이 높을수록 hallucination에 취약한 것)&lt;/li&gt;
&lt;li&gt;-: instruction 없이 문제만 / I1: Generate a short caption of the image / I2: Provide a brief description of the given image&lt;/li&gt;
&lt;li&gt;대부분의 모델들이 hallucination에 걸림, 심지어 small vision-language model보다 낮은 성능을 보이기도 함&amp;nbsp;&lt;/li&gt;
&lt;li&gt;InstructBLIP은 다른 모델에 비해 hallucination에 잘 걸리지 않은데, 그 이유는 InstructBLIP의 visual instruction data의 길이가 상대적으로 짧기 때문으로 추측할 수 있음. 다른 모델들의 visual instruction은 LLM으로부터 생성되어 상대적으로 길고 많은 정보가 포함되어 있어, 이것이 unexpected descriptive information을 포함하는 hallucination을 일으킬 수 있음&lt;/li&gt;
&lt;li&gt;또한, existing object hallucination evaluation method가 적절하지 않음. CHAIR의 문제는, 1) instruction의 뜻이 같아도 다른 형태면 평가 결과가 달라짐 (unstable), 2) CHAIR는 LVLM의 generation의 mentioned objects가 hallucinate된 것인지 아닌지를 조사해야 하는데, 이는 복잡한 rule이 필요하기 때문에 평가가 어려움&lt;/li&gt;
&lt;li&gt;Polling-based Object Probing Evaluation (POPE) 제시 -&amp;gt; instruction-based evaluation을 yes-or-no evaluation으로 바꿈으로써 more stable &amp;amp; flexible 평가 가능 (e.g., Is there a car in the image?)&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;878&quot; data-origin-height=&quot;256&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/beQpzl/btsPVdwbWIq/AvXXgJ9Jq7w04yWdkv4roK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/beQpzl/btsPVdwbWIq/AvXXgJ9Jq7w04yWdkv4roK/img.png&quot; data-alt=&quot;I: instance-level, S: sentence-level&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/beQpzl/btsPVdwbWIq/AvXXgJ9Jq7w04yWdkv4roK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbeQpzl%2FbtsPVdwbWIq%2FAvXXgJ9Jq7w04yWdkv4roK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;466&quot; height=&quot;136&quot; data-origin-width=&quot;878&quot; data-origin-height=&quot;256&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;I: instance-level, S: sentence-level&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1012&quot; data-origin-height=&quot;808&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/IBAdv/btsPYK66cIk/290hhjvWRkjhLj2JfxREq0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/IBAdv/btsPYK66cIk/290hhjvWRkjhLj2JfxREq0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/IBAdv/btsPYK66cIk/290hhjvWRkjhLj2JfxREq0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FIBAdv%2FbtsPYK66cIk%2F290hhjvWRkjhLj2JfxREq0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;487&quot; height=&quot;389&quot; data-origin-width=&quot;1012&quot; data-origin-height=&quot;808&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 style=&quot;color: #000000; text-align: start;&quot; data-ke-size=&quot;size23&quot;&gt;&lt;span style=&quot;font-family: 'Noto Sans Demilight', 'Noto Sans KR';&quot;&gt;&lt;b&gt;Influence of Instruction Data on Object Hallucination&lt;/b&gt;&lt;/span&gt;&lt;/h3&gt;
&lt;hr contenteditable=&quot;false&quot; data-ke-type=&quot;horizontalRule&quot; data-ke-style=&quot;style5&quot; /&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;hypotheses&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;대부분의 visual instruction tuning dataset으로 MSCOCO를 이용하는데, 이때 튜닝된 모델은 COCO 데이터셋에 많이 등장하는 object를 생성하려고 하는 bias가 존재&lt;/li&gt;
&lt;li&gt;given image의 ground-truth object와 co-occurring object groups (e.g., laptop-mouse-keyboard)가 발생할 확률이 높음 (e.g., laptop이 ground-truth로 등장하면 mouse가 없는데도 mouse를 언급함)&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;qualitative analysis&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;(a): MSCOCO에서 가장 많이 나온 top-10 object가 hallucinate된 횟수 count&lt;/li&gt;
&lt;li&gt;(b): dining table 단어와 가장 많이 나온 top-10 object가, 실제로 dining table이 포함된 image에서 발생한 hallucination 횟수 count&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;2090&quot; data-origin-height=&quot;1342&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bCHr5B/btsPZtw2a6p/SogzO5LdFak9HO2HkdnCV0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bCHr5B/btsPZtw2a6p/SogzO5LdFak9HO2HkdnCV0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bCHr5B/btsPZtw2a6p/SogzO5LdFak9HO2HkdnCV0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbCHr5B%2FbtsPZtw2a6p%2FSogzO5LdFak9HO2HkdnCV0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;650&quot; height=&quot;417&quot; data-origin-width=&quot;2090&quot; data-origin-height=&quot;1342&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;quantitative analysis&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;n: the total number of images: image 개수 (하나의 image 당 여러 개의 objects가 있으므로 여러 개의 hallucination이 발생할 수 있음)&lt;/li&gt;
&lt;li&gt;Hallucinated(i): the number of hallucinated objects in the i-th example: i번째 image에서 발생한 hallucinate된 obejct 개수&lt;/li&gt;
&lt;li&gt;Hit@k(i): the number of top-k frequently appearing MSCOCO objects in Hallucinated(i): i번째 image에서 발생한 hallucinate된 object 중 top-k frequent에 속하는 objects 개수&lt;/li&gt;
&lt;li&gt;Hit@k(i, o): the number of top-k frequently co-occurring objects with the probing object o in Hallucinated(i): i번째 image에서 발생한 hallucinate된 object 중 probing object o (ground-truth object 중 하나; dining table)와 top-k co-occurring하는 objects 개수&lt;/li&gt;
&lt;li&gt;즉, HR@k는 전체 hallucinated objects 중 most frequent objects / co-occurring objects의 비율이 어느 정도로 큰 지 측정함&lt;/li&gt;
&lt;li&gt;k=10일 때, HR_A의 수치가 0.5~0.6인 것으로 보아 i번째 image에서 생성된 response에서 발생한 hallucinated objects의 절반 이상은 top-k frequent objects / dining table과 co-occurring objects임&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imagegridblock&quot;&gt;
  &lt;div class=&quot;image-container&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/ddAyyi/btsPX63MgMw/U1uu27w8kVFScWkiAnifqk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/ddAyyi/btsPX63MgMw/U1uu27w8kVFScWkiAnifqk/img.png&quot; data-origin-width=&quot;748&quot; data-origin-height=&quot;168&quot; data-is-animation=&quot;false&quot; style=&quot;width: 51.0769%; margin-right: 10px;&quot; data-widthpercent=&quot;51.68&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/ddAyyi/btsPX63MgMw/U1uu27w8kVFScWkiAnifqk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FddAyyi%2FbtsPX63MgMw%2FU1uu27w8kVFScWkiAnifqk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;748&quot; height=&quot;168&quot;/&gt;&lt;/span&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cR1opO/btsPVgzHCN9/OjTsHwSTfowlv2cyAwr63k/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cR1opO/btsPVgzHCN9/OjTsHwSTfowlv2cyAwr63k/img.png&quot; data-origin-width=&quot;816&quot; data-origin-height=&quot;196&quot; data-is-animation=&quot;false&quot; style=&quot;width: 47.7603%;&quot; data-widthpercent=&quot;48.32&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cR1opO/btsPVgzHCN9/OjTsHwSTfowlv2cyAwr63k/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcR1opO%2FbtsPVgzHCN9%2FOjTsHwSTfowlv2cyAwr63k%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;816&quot; height=&quot;196&quot;/&gt;&lt;/span&gt;&lt;/div&gt;
&lt;/figure&gt;
&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1550&quot; data-origin-height=&quot;478&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cP4Vky/btsPVfgygwC/6KZaAZLUkw2dGfwyGHkPYk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cP4Vky/btsPVfgygwC/6KZaAZLUkw2dGfwyGHkPYk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cP4Vky/btsPVfgygwC/6KZaAZLUkw2dGfwyGHkPYk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcP4Vky%2FbtsPVfgygwC%2F6KZaAZLUkw2dGfwyGHkPYk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;522&quot; height=&quot;161&quot; data-origin-width=&quot;1550&quot; data-origin-height=&quot;478&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 style=&quot;color: #000000; text-align: start;&quot; data-ke-size=&quot;size23&quot;&gt;&lt;span style=&quot;font-family: 'Noto Sans Demilight', 'Noto Sans KR';&quot;&gt;&lt;b&gt;POPE&lt;/b&gt;&lt;/span&gt;&lt;/h3&gt;
&lt;hr contenteditable=&quot;false&quot; data-ke-type=&quot;horizontalRule&quot; data-ke-style=&quot;style5&quot; /&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;exisitng evaluation method의 한계&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;평가가 instruction에 민감하며 short caption에 bias됨 (e.g., InstructBLIP의 성능이 다른 모델에 비해 더 잘 나옴)&lt;/li&gt;
&lt;li&gt;모델의 response를 parsing해야 하는 번거로움이 있음&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;dataset&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;long response를 요구하는 instruction 대신 yes/no 대답을 요구하는 prompt로 변경 -&amp;gt; 깔끔한 평가 가능&lt;/li&gt;
&lt;li&gt;sampling strategies를 이용해 LVLM이 쉽게 hallucinate되는 objects를 추출해 hard question 생성&lt;/li&gt;
&lt;li&gt;하나의 데이터가 &amp;lt;image, {q(oi), ai}_i=1~l&amp;gt;으로 구성돼 있음. 즉, image x에 대해 l개의 question-answer 쌍이 있는데, 이는 i번째 object oi에 대한 것임. 또한 q(oi)는 yes/no로 답할 수 있는 문제이며 (e.g., Is there a/an &amp;lt;object&amp;gt; in the image?) ai는 yes/no 중 하나임&lt;/li&gt;
&lt;li&gt;oi는 annotations 또는 automatic segmentation tools (e.g., SEEM)으로부터 얻을 수 있음 (annotations이란 image에 있는 물체의 이름들)&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;pipeline&amp;nbsp;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;human annotation 또는 SEEM으로 ground-truth objects를 구함&lt;/li&gt;
&lt;li&gt;nonexistent objects (response가 no인 예제)를 만들기 위해 negative sampling 이용&amp;nbsp;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;random sampling: image에 존재하지 않는 objects를 랜덤으로 추출&lt;/li&gt;
&lt;li&gt;popular sampling: image에 존재하지 않는 top-k frequent objects 추출 (k=l/2)&lt;/li&gt;
&lt;li&gt;adversarial sampling: 모든 ground-truth objects와 co-occurring하는 모든 objects를 나열하고, 그 중에서 image에 존재하지 않는 top-k frequent objects 추출&lt;/li&gt;
&lt;li&gt;most frequent &amp;amp; gt와 co-occurring한 object에 대한 질문일수록 모델이 hallucinate될 가능성이 높기 때문에 어려운 문제가 됨&amp;nbsp;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;2106&quot; data-origin-height=&quot;788&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/ySLnP/btsPW1hxHsv/RpXUr8Xuqkf4vx9d32ZDr0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/ySLnP/btsPW1hxHsv/RpXUr8Xuqkf4vx9d32ZDr0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/ySLnP/btsPW1hxHsv/RpXUr8Xuqkf4vx9d32ZDr0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FySLnP%2FbtsPW1hxHsv%2FRpXUr8Xuqkf4vx9d32ZDr0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;2106&quot; height=&quot;788&quot; data-origin-width=&quot;2106&quot; data-origin-height=&quot;788&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;results&amp;nbsp;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;500 images with more than 3 ground-truth objects and construct 6 questions for each image (l=6)&lt;/li&gt;
&lt;li&gt;llava, multimodal-GPT, mPLUG-Owl은 yes bias를 보임 (overconfident) -&amp;gt; no가 정답인 예제에 대해선 낮은 acc를 보임&lt;/li&gt;
&lt;li&gt;모델의 성능이 random &amp;gt; popular &amp;gt; adversarial 순으로 감소하고 있는데, 이는 모델이 most frequent / co-occurring with ground-truth object objects에 쉽게 hallucinate된다는 것을 증명함&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;2608&quot; data-origin-height=&quot;1390&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/ezCDz7/btsPYKF8MdL/xf7hQk3ZUWBT3F07REJfp0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/ezCDz7/btsPYKF8MdL/xf7hQk3ZUWBT3F07REJfp0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/ezCDz7/btsPYKF8MdL/xf7hQk3ZUWBT3F07REJfp0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FezCDz7%2FbtsPYKF8MdL%2Fxf7hQk3ZUWBT3F07REJfp0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;2608&quot; height=&quot;1390&quot; data-origin-width=&quot;2608&quot; data-origin-height=&quot;1390&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;analysis&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;stability: instruction에 민감하고 short response bias된 평가를 하는 CHAIR와 다르게 prompt가 달라져도 충분히 작은 std로 안정성을 보임&lt;/li&gt;
&lt;li&gt;scalability: automatic segmentation tool (e.g., SEEM)을 이용해 annotation이 없는 데이터셋에 대해서도 쉽게 POPE 데이터셋 형태로 확장할 수 있음&lt;/li&gt;
&lt;li&gt;consistency: 모델의 yes/no response와 모델의 caption response를 비교함. no 대답을 받은 1301/1445개의 objects가 0/5개의 caption에 포함되어 있었음. yes 대답을 받은 664/1034개의 objects가 664/961개의 caption에 포함되어 있었음.&amp;nbsp;&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;impact of hallucination on vision tasks&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;정말 hallucination이 다른 vision task에 부정적인 영향을 끼칠까?&lt;/li&gt;
&lt;li&gt;POPE와 VQA의 성능 차이를 보아, hallucination에 잘 걸리지 않는다고 항상 VQA를 잘하는 것은 아님.&amp;nbsp;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1094&quot; data-origin-height=&quot;514&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/1xOJL/btsPX2AoOK9/adKIV3NZ6LiWkpHqxTrM50/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/1xOJL/btsPX2AoOK9/adKIV3NZ6LiWkpHqxTrM50/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/1xOJL/btsPX2AoOK9/adKIV3NZ6LiWkpHqxTrM50/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2F1xOJL%2FbtsPX2AoOK9%2FadKIV3NZ6LiWkpHqxTrM50%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;511&quot; height=&quot;240&quot; data-origin-width=&quot;1094&quot; data-origin-height=&quot;514&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 style=&quot;color: #000000; text-align: start;&quot; data-ke-size=&quot;size23&quot;&gt;&lt;span style=&quot;font-family: 'Noto Sans Demilight', 'Noto Sans KR';&quot;&gt;&lt;b&gt;Limitation&lt;/b&gt;&lt;/span&gt;&lt;/h3&gt;
&lt;hr contenteditable=&quot;false&quot; data-ke-type=&quot;horizontalRule&quot; data-ke-style=&quot;style5&quot; /&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;object hallucination에만 집중하고, LVLM의 overall performance를 평가하지 못함.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;가끔 LVLM이 yes/no로 답하지 않아 부정확한 평가가 됐을 수도 있음.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;SEEM을 사용해 annotation을 추출하기 때문에 human-labeled의 결과와 다를 수 있음.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;</description>
      <category>  VLM</category>
      <author>MINAIR</author>
      <guid isPermaLink="true">https://minair.tistory.com/129</guid>
      <comments>https://minair.tistory.com/129#entry129comment</comments>
      <pubDate>Tue, 19 Aug 2025 19:00:55 +0900</pubDate>
    </item>
    <item>
      <title>A Survey of State of the Art LVLMs: Alignment, Benchmark, Evaluations and Challenges</title>
      <link>https://minair.tistory.com/128</link>
      <description>&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;span style=&quot;font-family: AppleSDGothicNeo-Regular, 'Malgun Gothic', '맑은 고딕', dotum, 돋움, sans-serif;&quot;&gt;&lt;b&gt;Paper&lt;/b&gt;&lt;/span&gt;&lt;/h3&gt;
&lt;hr contenteditable=&quot;false&quot; data-ke-type=&quot;horizontalRule&quot; data-ke-style=&quot;style5&quot; /&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2501.02189&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2501.02189&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1754993748866&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;A Survey of State of the Art Large Vision Language Models: Alignment, Benchmark, Evaluations and Challenges&quot; data-og-description=&quot;Multimodal Vision Language Models (VLMs) have emerged as a transformative topic at the intersection of computer vision and natural language processing, enabling machines to perceive and reason about the world through both visual and textual modalities. For&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2501.02189&quot; data-og-url=&quot;https://arxiv.org/abs/2501.02189v6&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/vvC3r/hyZuEX2alc/pZgg5km3HnBja2f2LEVrbk/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/cMXKi9/hyZvvs3Kfr/wUpP9z0r0h2XZbwmHa9h5k/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2501.02189&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2501.02189&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/vvC3r/hyZuEX2alc/pZgg5km3HnBja2f2LEVrbk/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/cMXKi9/hyZvvs3Kfr/wUpP9z0r0h2XZbwmHa9h5k/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;A Survey of State of the Art Large Vision Language Models: Alignment, Benchmark, Evaluations and Challenges&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Multimodal Vision Language Models (VLMs) have emerged as a transformative topic at the intersection of computer vision and natural language processing, enabling machines to perceive and reason about the world through both visual and textual modalities. For&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 style=&quot;color: #000000; text-align: start;&quot; data-ke-size=&quot;size23&quot;&gt;&lt;span style=&quot;font-family: AppleSDGothicNeo-Regular, 'Malgun Gothic', '맑은 고딕', dotum, 돋움, sans-serif;&quot;&gt;&lt;b&gt;Introduction&lt;/b&gt;&lt;/span&gt;&lt;/h3&gt;
&lt;hr contenteditable=&quot;false&quot; data-ke-type=&quot;horizontalRule&quot; data-ke-style=&quot;style5&quot; /&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;모델의 스케일을 계속해서 키움으로써 발생하는 한계&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;모델을 훈련시킬 충분한 양의 high-quality 데이터 부족&lt;/li&gt;
&lt;li&gt;여러 개의 modality가 서로를 이해하는 선천적 능력 부족&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 style=&quot;color: #000000; text-align: start;&quot; data-ke-size=&quot;size23&quot;&gt;&lt;span style=&quot;font-family: AppleSDGothicNeo-Regular, 'Malgun Gothic', '맑은 고딕', dotum, 돋움, sans-serif;&quot;&gt;&lt;b&gt;SoTA VLM&lt;/b&gt;&lt;/span&gt;&lt;/h3&gt;
&lt;hr contenteditable=&quot;false&quot; data-ke-type=&quot;horizontalRule&quot; data-ke-style=&quot;style5&quot; /&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;VLM의 benchmark &amp;amp; evaluation&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;multimodal data를 모으고 생성하여 benchmark 구축&lt;/li&gt;
&lt;li&gt;benchmark는 주로 QA 형태로, LVLM의 visual-text understanding, chart understanding, video understanding 능력을 평가하는 데 목적이 있음&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 style=&quot;color: #000000; text-align: start;&quot; data-ke-size=&quot;size23&quot;&gt;&lt;span style=&quot;font-family: AppleSDGothicNeo-Regular, 'Malgun Gothic', '맑은 고딕', dotum, 돋움, sans-serif;&quot;&gt;&lt;b&gt;Building Blocks and Training Methods&lt;/b&gt;&lt;/span&gt;&lt;/h3&gt;
&lt;hr contenteditable=&quot;false&quot; data-ke-type=&quot;horizontalRule&quot; data-ke-style=&quot;style5&quot; /&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;vision encoder&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;visual input을 LLM embedding과 잘 align하는 embedding으로 나타내는 것, 즉 visual-text relationship을 반영한 image data의 representation을 학습함&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;text encoder &amp;amp; text decoder&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;text encoder: text token을 embedding으로 만드는 모델로, CLIP, BLIP 등에서 사용됐다. 그러나, 최신 모델 LLaVA는 text encoder를 없애고 LLM을 사용해 바로 text embedding을 추출한다.&amp;nbsp;&lt;/li&gt;
&lt;li&gt;text decoder: text encoder를 빼고, visual encoder로 매핑된 visual embedding을 projection layer를 사용해 투영시켜 visual information을 LLM space로 매핑한다. 이후 LLM이 매핑된 visual information과 text를 입력으로 받아 text를 생성한다.&amp;nbsp;&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;cross-attention mechanism&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;modality 사이의 attention score을 이용해 visual-text iteraction을 가능하게 한다.&amp;nbsp;&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 style=&quot;color: #000000; text-align: start;&quot; data-ke-size=&quot;size23&quot;&gt;&amp;nbsp;&lt;/h3&gt;
&lt;h3 style=&quot;color: #000000; text-align: start;&quot; data-ke-size=&quot;size23&quot;&gt;&lt;span style=&quot;font-family: AppleSDGothicNeo-Regular, 'Malgun Gothic', '맑은 고딕', dotum, 돋움, sans-serif;&quot;&gt;&lt;b&gt;Benchmarks and Evaluation&lt;/b&gt;&lt;/span&gt;&lt;/h3&gt;
&lt;hr contenteditable=&quot;false&quot; data-ke-type=&quot;horizontalRule&quot; data-ke-style=&quot;style5&quot; /&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;font-family: AppleSDGothicNeo-Regular, 'Malgun Gothic', '맑은 고딕', dotum, 돋움, sans-serif;&quot;&gt;단순한 QA 형태보다 모델의 다양한 multimodality 능력을 평가할 수 있는 benchmark가 필요하다.&lt;/span&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;font-family: AppleSDGothicNeo-Regular, 'Malgun Gothic', '맑은 고딕', dotum, 돋움, sans-serif;&quot;&gt;어떻게 benchmark data를 수집할 수 있는가?&amp;nbsp;&lt;/span&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;fully human-annotated datasets: 사람이 end-to-end하게 데이터를 수집 &amp;amp; QA pair 생성한 benchmark (e.g., MMLU, VCR) 그러나, time-consuming &amp;amp; hard to scale의 명확한 한계가 존재하여 자동으로 질문을 생성하고 이후 사람이 validate하는 방법이 선호됨&lt;/li&gt;
&lt;li&gt;synthetic question generation: human written example을 seed example로 삼고, 이를 powerful LLM (e.g., GPT-4)에게 shot으로 주어 hard example question &amp;amp; answer sample을 생성하도록 함. 그러나, LLM에게 많이 의존하는 방식이기 때문에 hallucinated content가 생성될 수 있음. 이를 방지하기 위해 low-quality sample을 필터링하는 단계를 추가하곤 함. 또한, powerful LLM이 너무 쉬운 sample을 생성하면 VLM의 성능을 평가하고자 하는 benchmark의 목적이 흐려지기 때문에 적절한 난이도 조절 역시 benchmark 구축에 있어 중요한 요소임.&amp;nbsp;&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;어떻게 VLM의 response를 평가하는가?&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;lexcial 평가보다 semantic 평가가 중요함&lt;/li&gt;
&lt;li&gt;완벽한 evaluation metric은 없기 때문에 yes/no 평가나 multiple-choice 평가가 가장 쉽다고 알려짐&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;현재 benchmark의 한계&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;VLM이 LLM을 backbone으로 사용하기 때문에, 실제 question / visual context를 고려하지 않고 powerful LLM에 의존해 작동하고 있을 수 있음 (prior knowledge - given context tradeoff 문제)&lt;/li&gt;
&lt;li&gt;현재 benchmark는 QA, multiple choice 같은 형식에만 국한되어 있음&lt;/li&gt;
&lt;/ul&gt;</description>
      <category>  VLM</category>
      <author>MINAIR</author>
      <guid isPermaLink="true">https://minair.tistory.com/128</guid>
      <comments>https://minair.tistory.com/128#entry128comment</comments>
      <pubDate>Tue, 12 Aug 2025 19:41:48 +0900</pubDate>
    </item>
    <item>
      <title>HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in LVLMs</title>
      <link>https://minair.tistory.com/127</link>
      <description>&lt;h3 style=&quot;color: #000000; text-align: start;&quot; data-ke-size=&quot;size23&quot;&gt;&lt;span style=&quot;font-family: AppleSDGothicNeo-Regular, 'Malgun Gothic', '맑은 고딕', dotum, 돋움, sans-serif;&quot;&gt;&lt;b&gt;Paper&lt;/b&gt;&lt;/span&gt;&lt;/h3&gt;
&lt;hr contenteditable=&quot;false&quot; data-ke-type=&quot;horizontalRule&quot; data-ke-style=&quot;style5&quot; /&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2310.14566&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2310.14566&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1754995355843&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language M&quot; data-og-description=&quot;We introduce HallusionBench, a comprehensive benchmark designed for the evaluation of image-context reasoning. This benchmark presents significant challenges to advanced large visual-language models (LVLMs), such as GPT-4V(Vision), Gemini Pro Vision, Claud&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2310.14566&quot; data-og-url=&quot;https://arxiv.org/abs/2310.14566v5&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/cRi2Tg/hyZvwepOo0/iMogpfpkBlAJSsPklz6Wn1/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/bAVoVD/hyZuGBz6dF/OlkIVEWvjtW47lKstT7eT1/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2310.14566&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2310.14566&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/cRi2Tg/hyZvwepOo0/iMogpfpkBlAJSsPklz6Wn1/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/bAVoVD/hyZuGBz6dF/OlkIVEWvjtW47lKstT7eT1/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language M&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;We introduce HallusionBench, a comprehensive benchmark designed for the evaluation of image-context reasoning. This benchmark presents significant challenges to advanced large visual-language models (LVLMs), such as GPT-4V(Vision), Gemini Pro Vision, Claud&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 style=&quot;color: #000000; text-align: start;&quot; data-ke-size=&quot;size23&quot;&gt;&lt;span style=&quot;font-family: AppleSDGothicNeo-Regular, 'Malgun Gothic', '맑은 고딕', dotum, 돋움, sans-serif;&quot;&gt;&lt;b&gt;Introduction&lt;/b&gt;&lt;/span&gt;&lt;/h3&gt;
&lt;hr contenteditable=&quot;false&quot; data-ke-type=&quot;horizontalRule&quot; data-ke-style=&quot;style5&quot; /&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;language bias&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;powerful LLM의 prior knowledge와 visual context 사이의 conflict에서 prior knowledge를 우선시하는 문제&lt;/li&gt;
&lt;li&gt;즉, actual content of question을 고려하지 않는 문제 발생&amp;nbsp;&lt;/li&gt;
&lt;li&gt;결국 hallucination으로까지 문제가 이어짐&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;논문의 contribution&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;HallusionBench 구축
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;165개의 original images + 181개의 modified by human professional images = 346개의 images&lt;/li&gt;
&lt;li&gt;1129개의 visual question-answer (VQA) pairs&lt;/li&gt;
&lt;li&gt;15개의 모델에 대해 HallusionBench로 성능 평가&lt;/li&gt;
&lt;li&gt;SoTA LVLMs이 어디에서 실패하는 지 분석&lt;/li&gt;
&lt;li&gt;object hallucination만 다뤘던 이전 연구 (e.g., POPE, GAVIE)와 다르게 visual illusion, language hallucination을 모두 평가하는 첫 번째 벤치마크&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 style=&quot;color: #000000; text-align: start;&quot; data-ke-size=&quot;size23&quot;&gt;&lt;span&gt;&lt;b&gt;HallusionBench Construction&lt;/b&gt;&lt;/span&gt;&lt;/h3&gt;
&lt;hr contenteditable=&quot;false&quot; data-ke-type=&quot;horizontalRule&quot; data-ke-style=&quot;style5&quot; /&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;benchmark의 목적은 모델의 language bias를 평가해 모델의 response가 hallucinate되었는지 아닌지를 평가하는 것이다. VLM에서 hallucination이란 image에 없는 정보가 포함된 response를 생성하는 것이다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;visual dependent questions&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;visual context 없이는 풀 수 없는 문제 (e.g., Is the right orange circle the same size as the left orange circle?)&lt;/li&gt;
&lt;li&gt;평가하고자 하는 것들
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;모델의 visual understanding/reasoning skill이 얼마나 뛰어난가?&lt;/li&gt;
&lt;li&gt;모델이 얼마나 parametric memory에 의존하고 있는가?&lt;/li&gt;
&lt;li&gt;모델이 multiple images 사이의 temporal relation을 잘 인식하는가?&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;visual supplement questions&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;visual context 없이 prior knowledge만으로 풀 수 있는 문제 (e.g., Is new Maxico state larger than Texas state?)&lt;/li&gt;
&lt;li&gt;평가하고자 하는 것들
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;모델이 prior knowledge가 부족한 경우에도 image에 대한 hallucination이 발생하는가?&lt;/li&gt;
&lt;li&gt;모델이 충분한 prior knowledge를 갖고 있어도 visual supplement를 통해 extra information을 수집해 response를 발전시킬 수 있는가?&lt;/li&gt;
&lt;li&gt;모델에게 graph, chart, map 등의 visual input이 주어졌을 때 얼마나 잘 해석할 수 있는가?&amp;nbsp;&lt;/li&gt;
&lt;li&gt;어떤 타입의 image manipulation이 visual information extraction을 가장 방해하는가?&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;notation&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;전체 이미지 집합 = empty image + original image set + (각 original image에 대한) modified image set&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;font-family: -apple-system, BlinkMacSystemFont, 'Helvetica Neue', 'Apple SD Gothic Neo', Arial, sans-serif; letter-spacing: 0px;&quot;&gt;평가의 용이성을 위해 모든 visual-question을 {yes, no}로 annotate함.&amp;nbsp;&lt;/span&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;658&quot; data-origin-height=&quot;72&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/1oc3V/btsPRAcbGT7/leIA4JOjmp9XRtaNkKY0Sk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/1oc3V/btsPRAcbGT7/leIA4JOjmp9XRtaNkKY0Sk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/1oc3V/btsPRAcbGT7/leIA4JOjmp9XRtaNkKY0Sk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2F1oc3V%2FbtsPRAcbGT7%2FleIA4JOjmp9XRtaNkKY0Sk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;320&quot; height=&quot;72&quot; data-origin-width=&quot;658&quot; data-origin-height=&quot;72&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 style=&quot;color: #000000; text-align: start;&quot; data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;HallusionBench Evaluation Suite&lt;/b&gt;&lt;/h3&gt;
&lt;hr contenteditable=&quot;false&quot; data-ke-type=&quot;horizontalRule&quot; data-ke-style=&quot;style5&quot; /&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;text-only GPT4-Assisted Evaluation&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;M(I, q) \(\in\) {yes, no, uncertain}: input (VQ pair)에 대한 VLM의 응답&lt;/li&gt;
&lt;li&gt;y(I, q) \(\in\) {yes, no}: 실제 응답&lt;/li&gt;
&lt;li&gt;GPT-4 \(GPT(M(I, q), y(I, q))\) \(\in\) {incorrect(0), correct (1), uncertain (2)}: GPT가 VLM의 응답을 GT와 평가. 이때 GPT-4에 variance가 있으므로 GPT-4가 VLM의 응답을 3번 평가하게 하고 그 평균으로 최종 평가를 내리도록 함
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;GPT4-assisted evaluation의 효과를 검증하기 위해 human evaluation과 차이를 비교해봄 -&amp;gt; negligible한 차이를 보임 (effective)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Correctness Evaluation Metrics (accuracy to diagnose the failures of LVLMs)&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;response와 GT 사이의 correctness 점수 [0, 1]&lt;/li&gt;
&lt;li&gt;All accuracy: 전체 VQ 쌍에 대한 correctness 점수 합의 비율&lt;/li&gt;
&lt;li&gt;Figure Accuracy: \(I_{(i, j)}\)는 i번째 original image로부터 생성된 j번째 modified image를 의미함. 그 이미지와 i번째 이미지에 대한 모든 질문 q에 대해 정답을 맞춰야지만 1점으로 간주&lt;/li&gt;
&lt;li&gt;Question Pair Accuracy: \(q_{(i, k)}\)는 i번째 image에 대한 k번째 질문을 의미함. i번째 original image + modified image가 \(q_{(i, k)}\)와 함께 주어졌을 때 모두 맞혀야 1점으로 간주&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1498&quot; data-origin-height=&quot;274&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bznv1o/btsPPCo3yzr/VTOfa7kqOkJP0iEnZHp0O1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bznv1o/btsPPCo3yzr/VTOfa7kqOkJP0iEnZHp0O1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bznv1o/btsPPCo3yzr/VTOfa7kqOkJP0iEnZHp0O1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fbznv1o%2FbtsPPCo3yzr%2FVTOfa7kqOkJP0iEnZHp0O1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;619&quot; height=&quot;113&quot; data-origin-width=&quot;1498&quot; data-origin-height=&quot;274&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 style=&quot;color: #000000; text-align: start;&quot; data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;Analytical Evaluation Criteria&lt;/b&gt;&lt;/h3&gt;
&lt;hr contenteditable=&quot;false&quot; data-ke-type=&quot;horizontalRule&quot; data-ke-style=&quot;style5&quot; /&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;accuracy 말고도 LVLM의 failure을 평가하기 위해 3가지 metric을 도입함.&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;yes/no bias test: 모델이 대부분 yes라고 대답하는 bias를 갖고 있음. Pct. Diff가 -1 또는 1에 가까울수록 심한 bias를 갖는 것.&amp;nbsp;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1460&quot; data-origin-height=&quot;340&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/c3Vz2W/btsPRoC8sUE/Xs06Pi7MyOo3B61vPflfh1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/c3Vz2W/btsPRoC8sUE/Xs06Pi7MyOo3B61vPflfh1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/c3Vz2W/btsPRoC8sUE/Xs06Pi7MyOo3B61vPflfh1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fc3Vz2W%2FbtsPRoC8sUE%2FXs06Pi7MyOo3B61vPflfh1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;439&quot; height=&quot;102&quot; data-origin-width=&quot;1460&quot; data-origin-height=&quot;340&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;false positive ratio (FP ratio): [0, 1] 사이의 값으로, W는 모델이 답을 틀린 경우의 (I, q) 집합임. 값이 0.5에 가까울수록 robust함&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;988&quot; data-origin-height=&quot;176&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/b9T51A/btsPP4SFiPg/rBAeKDQGJL87UWvZAWiEK0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/b9T51A/btsPP4SFiPg/rBAeKDQGJL87UWvZAWiEK0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/b9T51A/btsPP4SFiPg/rBAeKDQGJL87UWvZAWiEK0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fb9T51A%2FbtsPP4SFiPg%2FrBAeKDQGJL87UWvZAWiEK0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;461&quot; height=&quot;82&quot; data-origin-width=&quot;988&quot; data-origin-height=&quot;176&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;consistency test: 모델이 Qi에 있는 질문 중 일부만 맞힌다면 inconsistent, 다 맞히거나 다 틀린다면 consisent하다고 간주함&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;LVLM의 failure 원인을 2가지로 분류한다.&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;language hallucination: visual input과 관련 없는 질문이 주어질 때, 모델이 parametric memory에 기반해 visual input에 대한 false prior assumption을 만들어내기 때문에 hallucination 발생.&amp;nbsp;&lt;/li&gt;
&lt;li&gt;visual illusion: visual information에 대한 misinterpretation 때문에 발생하는 hallucination.&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;2가지 원인을 이용해 hallucination이 발생한 경우를 3가지로 나눌 수 있다.&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;visual dependent question 또는 visual supplement questions with visual inputs의 경우, LVLM의 response가 incorrect 또는 uncertain하다면 그건 visual illusion에 걸린 것&lt;/li&gt;
&lt;li&gt;visual supplement questions without visual inputs의 경우, 만약 LVLM의 response가 consistently incorrect하다면 그건 language hallucination에 걸린 것&lt;/li&gt;
&lt;li&gt;LVLM response가 original image와 modified image에 대해 모두 같다면 parametric knowledge가 overtake하고 given visual input의 정보를 활용하고 있지 못하는 것이기 때문에 그건 language hallucination에 걸린 것&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;950&quot; data-origin-height=&quot;624&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cwQyKa/btsPRzqQz3e/AuIIfHXgrWu03EA02VEqR1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cwQyKa/btsPRzqQz3e/AuIIfHXgrWu03EA02VEqR1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cwQyKa/btsPRzqQz3e/AuIIfHXgrWu03EA02VEqR1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcwQyKa%2FbtsPRzqQz3e%2FAuIIfHXgrWu03EA02VEqR1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;620&quot; height=&quot;407&quot; data-origin-width=&quot;950&quot; data-origin-height=&quot;624&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 style=&quot;color: #000000; text-align: start;&quot; data-ke-size=&quot;size23&quot;&gt;&amp;nbsp;&lt;/h3&gt;
&lt;h3 style=&quot;color: #000000; text-align: start;&quot; data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;Experimental Results&lt;/b&gt;&lt;/h3&gt;
&lt;hr contenteditable=&quot;false&quot; data-ke-type=&quot;horizontalRule&quot; data-ke-style=&quot;style5&quot; /&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;결과&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;GPT-4V가 대부분의 open-sourced LVLM의 성능을 능가함&lt;/li&gt;
&lt;li&gt;accuracy가 낮을수록 benchmark의 태스크를 푸는 데 어려움이 있다는 의미&lt;/li&gt;
&lt;li&gt;모델 사이즈를 키울수록 hallucination이 줄어듦&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1626&quot; data-origin-height=&quot;752&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/VNa4Q/btsPQx1oj46/mKBVQJmdbyEoW602KPeJa1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/VNa4Q/btsPQx1oj46/mKBVQJmdbyEoW602KPeJa1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/VNa4Q/btsPQx1oj46/mKBVQJmdbyEoW602KPeJa1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FVNa4Q%2FbtsPQx1oj46%2FmKBVQJmdbyEoW602KPeJa1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1626&quot; height=&quot;752&quot; data-origin-width=&quot;1626&quot; data-origin-height=&quot;752&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;결과2&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;LLaVA-1.5, Open-Flamingo, mPLUG-Owl-v1의 yes bias가 심한 것으로 드러남: Pct. Diff가 0에 가깝지 않고 FP Ratio가 0.5에 가깝지 않음&lt;/li&gt;
&lt;li&gt;그 원인으로, 모델이 imbalanced positive/negative sample로 훈련되기 때문 &amp;amp; human-edited data가 아니라 original images로만 훈련되기 때문이라고 추측&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1564&quot; data-origin-height=&quot;754&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bATgGV/btsPNOpMiw3/H0PbzknmJEGQPjdB82nq41/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bATgGV/btsPNOpMiw3/H0PbzknmJEGQPjdB82nq41/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bATgGV/btsPNOpMiw3/H0PbzknmJEGQPjdB82nq41/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbATgGV%2FbtsPNOpMiw3%2FH0PbzknmJEGQPjdB82nq41%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1564&quot; height=&quot;754&quot; data-origin-width=&quot;1564&quot; data-origin-height=&quot;754&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;결과3&lt;/p&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;GPT-4V, LLaVA-1.5 포함한 대부분의 모델이 Math, illusion, video가 가장 어려운 태스크로 밝혀짐&lt;/li&gt;
&lt;li&gt;이는 모델이 visual input을 분석하기보다 parametric memory에 의존하려고 하기 때문&lt;/li&gt;
&lt;li&gt;video의 sequence를 거꾸로 했을 때 모델이 변화를 잘 인식하지 못함&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 style=&quot;color: #000000; text-align: start;&quot; data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;Conclusion&lt;/b&gt;&lt;/h3&gt;
&lt;hr contenteditable=&quot;false&quot; data-ke-type=&quot;horizontalRule&quot; data-ke-style=&quot;style5&quot; /&gt;
&lt;ul style=&quot;list-style-type: circle;&quot; data-ke-list-type=&quot;circle&quot;&gt;
&lt;li&gt;모델의 parametric memory와 given context 사이의 trade-off를 발전시켜야 함을 보임&lt;/li&gt;
&lt;li&gt;모델이 prior knowledge를 갖고 있지 않아도 여전히 잘못된 response를 생성하는 것으로 보아, visual capability 능력이 떨어진다는 것을 보임&lt;/li&gt;
&lt;li&gt;simple image manipulations (modifications)에도 모델이 잘못된 response를 생성함&lt;/li&gt;
&lt;li&gt;모델이 multiple images의 temporal relations을 잘 인식하지 못함&lt;/li&gt;
&lt;/ul&gt;</description>
      <category>  VLM</category>
      <author>MINAIR</author>
      <guid isPermaLink="true">https://minair.tistory.com/127</guid>
      <comments>https://minair.tistory.com/127#entry127comment</comments>
      <pubDate>Tue, 12 Aug 2025 19:14:38 +0900</pubDate>
    </item>
    <item>
      <title>모델을 여러 개의 GPU에 로드해야 할 때</title>
      <link>https://minair.tistory.com/126</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;큰 모델을 GPU에 올리다 보면 CUDA out of memory 에러가 빈번하게 날 수 있다. device_map=&quot;auto&quot;로 사용 가능한 모든 GPU에 자동으로&amp;nbsp; 모델을 나눠서 올리는 것인데, 내가 원하는 GPU를 적접 정하고 싶은 경우에는 어떻게 할까? 내 경우에는 랩실 사람들끼리 사용하기로 한 GPU를 나눠서 지정했기 때문에 아래 방법을 찾아보게 되었다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;config.py에 device_map을 정의하고, 모델을 정의한 device_map으로 분산시켜 올린다.&amp;nbsp;&lt;/p&gt;
&lt;pre id=&quot;code_1754752538655&quot; class=&quot;python&quot; data-ke-language=&quot;python&quot; data-ke-type=&quot;codeblock&quot;&gt;&lt;code&gt;## opt-13b에 대한 레이어 분산 설정

device_map = {
    &quot;model.decoder.embed_tokens&quot;: 0,      
    &quot;model.decoder.embed_positions&quot;: 0,
    &quot;model.decoder.final_layer_norm&quot;: 0,
    &quot;lm_head&quot;: 0,
}

# 레이어 분산 설정 (0~19: cuda:0, 20~39: cuda:2)
for i in range(40):
    if i &amp;lt; 20:
        device_map[f&quot;model.decoder.layers.{i}&quot;] = 0
    else:
        device_map[f&quot;model.decoder.layers.{i}&quot;] = 2&lt;/code&gt;&lt;/pre&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;pre id=&quot;code_1754752636981&quot; class=&quot;python&quot; data-ke-language=&quot;python&quot; data-ke-type=&quot;codeblock&quot;&gt;&lt;code&gt;## 모델 레이어 분산 설정

model = model_class.from_pretrained(args.model_name_or_path, device_map=config.device_map)
tokenizer = tokenizer_class.from_pretrained(args.model_name_or_path)&lt;/code&gt;&lt;/pre&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;</description>
      <category> ️ 에러 해결 기록</category>
      <author>MINAIR</author>
      <guid isPermaLink="true">https://minair.tistory.com/126</guid>
      <comments>https://minair.tistory.com/126#entry126comment</comments>
      <pubDate>Sun, 10 Aug 2025 00:17:27 +0900</pubDate>
    </item>
    <item>
      <title>requirements.txt 만들기</title>
      <link>https://minair.tistory.com/125</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;필요 없는 가상환경은 메모리만 낭비하기 때문에 지워야 한다. 그러나 나중에 reproduce하기 위해서는 현재 가상환경의 셋팅이 필요하다. 그럴 때, 현재 가상환경에 설치된 라이브러리/패키지를 requirements.txt 파일로 저장한 뒤, 나중에 다시 설치해주면 같은 가상환경을 사용할 수 있다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;pre id=&quot;code_1754750210247&quot; class=&quot;bash&quot; data-ke-language=&quot;bash&quot; data-ke-type=&quot;codeblock&quot;&gt;&lt;code&gt;conda activate env_name # 내 가상환경 활성화
cd my_dir # requirements.txt 파일을 생성하고 싶은 디렉토리로 이동
pip freeze &amp;gt; requirements.txt 

# 이제 현재 가상환경 삭제 가능 

# 나중에 가상환경 복구하고 싶을 때
conda activate new_env # 새로운 가상환경 생성 후 활성화
pip install -r requirements.txt # 새로운 가상환경에 이전 가상환경의 라이브러리/패키지 복구됨&lt;/code&gt;&lt;/pre&gt;</description>
      <category> ️ 에러 해결 기록</category>
      <author>MINAIR</author>
      <guid isPermaLink="true">https://minair.tistory.com/125</guid>
      <comments>https://minair.tistory.com/125#entry125comment</comments>
      <pubDate>Sat, 9 Aug 2025 23:36:57 +0900</pubDate>
    </item>
  </channel>
</rss>