{"as_of":"2026-08-17T02:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1c9d78d2fea5350c82087d3d7b81b53d6626efbd428b118f12c33062a2dee6a3","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T20:24:58.878977Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.07801/citation-record","integrity":"/paper/2412.07801/integrity","json":"/paper/2412.07801/citation-record.json","paper":"/paper/2412.07801"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-11T20:24:58.425030Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.425030Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:b1c1fcb8e72f33a6f4248aad37f8bb71c47791abcf4781b002d1381c36a49aac","observation_id":"790c8798-03d9-4504-8ccf-54d08e7bf072","resolution":{"observed_at":"2026-08-11T20:24:58.425030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.904491Z","title":null,"venue":null,"work_id":"51156bcc-4ada-41f6-a954-dfb4381c3481","year":1956},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.432063Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:2e06ca561aec30c644e143e6cd7e7893d2a94369ec656c7cbcf7bf5d5e0e5a85","observation_id":"5f70e656-8f4c-4dee-b14f-8d411bf6034f","resolution":{"observed_at":"2026-08-11T20:24:59.912891Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00784","last_updated":"2024-04-27T01:53:39Z","snapshot_observed_at":"2026-08-16T14:38:22.650576Z","submitted_at":"2023-12-01T18:59:56Z","title":"ViP-LLaVA: Making Large Multimodal Models Understand Arbitrary Visual Prompts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00784","snapshot_observed_at":"2026-08-11T20:24:58.437445Z","title":"Meyer, Yuning Chai, Dennis Park, and Yong Jae Lee","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.437445Z"},"links":{"cited_paper":"/paper/2312.00784","citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:9231075d1dd11c96b8317e49ce5559d7f421d2b079b69ef6819f03af1bf76040","observation_id":"2f475124-5557-4af5-bb86-cc9b4615103b","resolution":{"observed_at":"2026-08-11T20:24:58.437445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.884759Z","title":null,"venue":null,"work_id":"05466140-ac91-471f-8a12-8bd5ef40c399","year":2024},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.443735Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:56e51e1cdde539900fb99190c15b13599610ecd048e86af738d35e8c9c2bb893","observation_id":"50808cd6-637b-4b00-b114-59b3415bfc99","resolution":{"observed_at":"2026-08-11T20:24:59.890233Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-16T01:18:27.067382Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-11T20:24:58.449192Z","title":"Lawrence Zitnick","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.449192Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:95ae7ecef31b7692916b74c7925e72e42e5dbdeebced739a9b21bef592ce0f6b","observation_id":"64141e42-e463-4479-b6a4-2716bd41526f","resolution":{"observed_at":"2026-08-11T20:24:58.449192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04901","last_updated":"2023-11-08T18:59:05Z","snapshot_observed_at":"2026-08-16T14:44:51.722771Z","submitted_at":"2023-11-08T18:59:05Z","title":"GENOME: GenerativE Neuro-symbOlic visual reasoning by growing and reusing ModulEs","version":1},"cited_work":{"arxiv_id":"2311.04901","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.04901","snapshot_observed_at":"2026-08-11T20:24:59.154802Z","title":"GENOME: GenerativE Neuro-symbOlic visual reasoning by growing and reusing ModulEs","venue":"cs.CV","work_id":"f5bccd1f-f131-4c02-be11-245fb9a451b4","year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.455119Z"},"links":{"cited_paper":"/paper/2311.04901","citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:15578302769834e5c95987ca0aafc4b50a2a81f6134b8a10b73d2fb56bea8298","observation_id":"25bb44e0-9842-43f0-933c-c4a146ef482a","resolution":{"observed_at":"2026-08-11T20:24:59.162779Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.864677Z","title":null,"venue":null,"work_id":"b2dce00a-1d85-4248-bc11-cda45c082612","year":2019},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.461139Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:96f4024beab2939f543fae7727aa6c1a88d963d7587d59e189618b5e3098b285","observation_id":"14514065-53ed-4e80-b78f-e4e6c592e48f","resolution":{"observed_at":"2026-08-11T20:24:59.870771Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.846544Z","title":null,"venue":null,"work_id":"0c9a5523-32ba-4d92-b393-2bc9e0ea54cc","year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.466405Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:5433d5a497e63741e142f95c2d31830d48fd7b9c01fff2432f42e685e246ec5e","observation_id":"7cbac773-d4e2-42f8-afae-c86776802ae5","resolution":{"observed_at":"2026-08-11T20:24:59.852174Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.829221Z","title":null,"venue":null,"work_id":"1f994779-df0b-43c8-bc31-2975f517f757","year":2017},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.471729Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:4d16bacdc3708961aa13d2575143e4c4aa5e199436378dc42953050b497f2b29","observation_id":"c75d2430-ec6c-4cc6-b6be-829c22d2981d","resolution":{"observed_at":"2026-08-11T20:24:59.834968Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:58.477261Z","title":"Denkowski and Alon Lavie","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.477261Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:8df110d8c9d92e887a237e4863ebebd72e16115a77ca49e1da3010450bf5e6ff","observation_id":"2b4a1ef3-f18e-4459-9032-739ecd622e59","resolution":{"observed_at":"2026-08-11T20:24:58.477261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.800245Z","title":null,"venue":null,"work_id":"1a977aca-d02e-4b0c-911a-254425bc089a","year":2022},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.483277Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:35151612f39e43a1ba9b340dcba0a079474f6242e75336e6f5775d46c2e6e027","observation_id":"e8d675cc-9123-4acc-a8df-805490dd1721","resolution":{"observed_at":"2026-08-11T20:24:59.805873Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.781409Z","title":null,"venue":null,"work_id":"d57e5d55-7f19-469a-b8c9-47ab22ed7776","year":2021},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.488805Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:85ebbea04d71f864c3054ce3626dfc6aad20699d41848db96a2050433032e51c","observation_id":"921dcef8-081a-49bf-9a5b-be5f7f332ebf","resolution":{"observed_at":"2026-08-11T20:24:59.788164Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.763689Z","title":null,"venue":null,"work_id":"4baec084-6748-424a-ae84-5270312856c0","year":2022},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.494049Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:8c26ab83c9cc5e3b40351212a6f8ecbc2e438a445a7146bb4e78f0f29fe6f9c7","observation_id":"0c246101-6ba5-4600-9a40-97bc84ac60f4","resolution":{"observed_at":"2026-08-11T20:24:59.768801Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.746796Z","title":null,"venue":null,"work_id":"f074964c-e250-4167-922a-ef442d4913b7","year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.499232Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:59e17d3d81882135f316a3d77a9e8ad374a7e9f8618975a84ba4514c4649f372","observation_id":"4a4be01c-0529-4f1b-8028-7f285b9dcad2","resolution":{"observed_at":"2026-08-11T20:24:59.752058Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:58.504570Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.504570Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:59c8a9ec468f373e931fa753838ef9203bf4ecc91ab753440224608e82976a7e","observation_id":"ab8ed105-1b73-4b39-8582-0dd4bd5aaf06","resolution":{"observed_at":"2026-08-11T20:24:58.504570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.701586Z","title":null,"venue":null,"work_id":"2337c7e8-a19b-4c51-a010-9934ab294da8","year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.514362Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:2bcc7d3ce9c4ce4cb8f90e3124d90467c1ed5a3cd75e497bfe5f02468d1f91c4","observation_id":"2a2eda67-9a97-492b-9ad3-1329bd7da263","resolution":{"observed_at":"2026-08-11T20:24:59.706687Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-16T14:34:47.701708Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-11T20:24:58.519379Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.519379Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:cefedf5c90b4f3a99962016babdf029be50e537085678fb96ae791b1749300a5","observation_id":"5cd10cf0-7fe7-494e-be3d-dfe74bc85bc4","resolution":{"observed_at":"2026-08-11T20:24:58.519379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:58.524903Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.524903Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:467bf4688042d33a4140993d40686d795e5e182de6d174a7ab2af07182a129e1","observation_id":"20c3ee62-04a4-4089-88a9-0f4cce49eba9","resolution":{"observed_at":"2026-08-11T20:24:58.524903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.672384Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":"c292d42b-db78-4242-8387-6731d2633c00","year":2015},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.530194Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:bf3572df47f9a942721fc58592f135dbcaed47a8e4014151e65d2d5e4e372f1a","observation_id":"275dea9a-0215-4473-8986-030724ec4b2d","resolution":{"observed_at":"2026-08-11T20:24:59.677780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.655028Z","title":"Berg, Wan-Yen Lo, Piotr Dollár, and Ross B","venue":null,"work_id":"4407bb97-0c70-4b1e-a6bc-9da88434870d","year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.535090Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:b88969ad58bb7ce0c055d63f6cfbd9617af839cc8e58c6e67d50a282ca6f2dc8","observation_id":"dc654adf-42e8-4256-a4aa-0f3a353552ba","resolution":{"observed_at":"2026-08-11T20:24:59.660576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03354","last_updated":"2023-11-06T18:59:44Z","snapshot_observed_at":"2026-08-16T14:45:33.725152Z","submitted_at":"2023-11-06T18:59:44Z","title":"CoVLM: Composing Visual Entities and Relationships in Large Language Models Via Communicative Decoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03354","snapshot_observed_at":"2026-08-11T20:24:58.539838Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.539838Z"},"links":{"cited_paper":"/paper/2311.03354","citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:32fdf31668a928a89523a2cfcba699666bddd4fa8583a36683ca780dafc38a3a","observation_id":"cac99366-4373-490d-94e6-68415c833b96","resolution":{"observed_at":"2026-08-11T20:24:58.539838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.637699Z","title":null,"venue":null,"work_id":"dd39f7a5-6ecc-4291-859c-af55967455cd","year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.545315Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:4bb91135925ef351f664b14812c62b66e14e2bfdf6a33f37f7caec7e24b8050e","observation_id":"2d0da285-c109-47aa-b918-2fd9c7eda274","resolution":{"observed_at":"2026-08-11T20:24:59.642935Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04387","last_updated":"2023-06-08T13:44:24Z","snapshot_observed_at":"2026-08-16T15:25:50.743743Z","submitted_at":"2023-06-07T12:35:37Z","title":"M$^3$IT: A Large-Scale Dataset towards Multi-Modal Multilingual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04387","snapshot_observed_at":"2026-08-11T20:24:58.550719Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.550719Z"},"links":{"cited_paper":"/paper/2306.04387","citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:2b6c770ac75cc72aac4eea964504d8f68b45eef9e3fc5cc4a4f97701f600e078","observation_id":"1559abe1-c76a-49ce-9955-1af00bb34dcc","resolution":{"observed_at":"2026-08-11T20:24:58.550719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.620710Z","title":null,"venue":null,"work_id":"3a0d5d7e-3f1d-41de-a967-30c75d15ab1e","year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.555914Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:b80b6e8d1df41e68bdbffcb371bc8e578ee0af584369ac23cac765e80b2b7804","observation_id":"658d37c1-7d72-4eff-9f20-939bb47d544c","resolution":{"observed_at":"2026-08-11T20:24:59.626229Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:58.561013Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.561013Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:031d7a889716de91b8826acc7ba18bdbf78fc8d96179288da8d59cee42b363a1","observation_id":"e70dd1b7-839c-484c-a383-85e087db8037","resolution":{"observed_at":"2026-08-11T20:24:58.561013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:58.567517Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.567517Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:f31d4b67b463ab0a00e84c761be5aac70b46f6cd50622c4fd3089161812e2dd4","observation_id":"5f0dfb67-64ca-40b6-b389-a738aae19a75","resolution":{"observed_at":"2026-08-11T20:24:58.567517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:58.578527Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.578527Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:de744afe4a3e898e652a9e5fc56d2d46b920e308824ec6be689e8b6cc7577ec7","observation_id":"92e8eab5-74f5-476a-ad56-5fe9422b1f8c","resolution":{"observed_at":"2026-08-11T20:24:58.578527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.571328Z","title":null,"venue":null,"work_id":"e5e19ac5-f327-4c81-8d80-f0c200e3de34","year":2022},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.584012Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:eaee3266530c076007aa4e0d6bf29f3b27c199c2d0bf578093cd935bf710629a","observation_id":"899be0ed-b6eb-4741-baf5-e4c880407304","resolution":{"observed_at":"2026-08-11T20:24:59.576349Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.554440Z","title":null,"venue":null,"work_id":"b60092ac-84db-462e-8b74-8f8a794649f1","year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.591364Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:05c25fc0f0980c40bed233a179d12005ca5ac53f789034a860752ab53457ff51","observation_id":"85752bf9-44d1-400a-8af0-f1ce44d17d44","resolution":{"observed_at":"2026-08-11T20:24:59.559580Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:58.596247Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.596247Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:9a26aee721f42a9c92f564eb079d8fe7af7fb254b3ac5a0fdafb0c013c12ed1d","observation_id":"18b32937-f368-4a53-9a9a-b89f76acc998","resolution":{"observed_at":"2026-08-11T20:24:58.596247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.507131Z","title":null,"venue":null,"work_id":"ca8fdec3-d4d4-42ca-a2e2-45c57b534e36","year":1930},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.607320Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:78ed574159f4377029c61e05d471684b8379022bd244d46c1358449bd92e9eb0","observation_id":"73aa19b9-73fc-4f89-9d2a-d2d2160581a6","resolution":{"observed_at":"2026-08-11T20:24:59.512461Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-16T19:40:28.523700Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T20:24:58.612361Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.612361Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:5578452c5b213e471bc1808f1205f37493396d86890832f1372971a8f3af53bf","observation_id":"45596e47-4c02-413e-9243-713085d537eb","resolution":{"observed_at":"2026-08-11T20:24:58.612361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:58.617162Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.617162Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:db5f820c0d5a4038bcc480af3d244ab938897f6c5f558d0a43176c2823e2ab9f","observation_id":"0a27c4ff-5407-4580-bdae-a687dee04113","resolution":{"observed_at":"2026-08-11T20:24:58.617162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:58.622124Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.622124Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:c7a5ac9cad2d4259878146b0b72618c22823f82ec2ab6b2db7ab8838c910cd50","observation_id":"e35e6e2f-2904-4124-b73d-2d1bac1c03eb","resolution":{"observed_at":"2026-08-11T20:24:58.622124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:58.628076Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.628076Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:9bdd511d8bc1bb3b12cbea0941008ab3332b17e2a1b86436bd84c8e9be3e75ae","observation_id":"fb109178-c86e-4de6-80c4-3d6bf72b8017","resolution":{"observed_at":"2026-08-11T20:24:58.628076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:58.633094Z","title":"Manning, Stefano Ermon, and Chelsea Finn","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.633094Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:280e2c0fc83369edc39cb39f3a7c3712eab43b2d5d511e43f8fa18c4c9992aad","observation_id":"8358eb97-4623-42e2-b989-7051911c20c5","resolution":{"observed_at":"2026-08-11T20:24:58.633094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.443326Z","title":null,"venue":null,"work_id":"ca977699-d9a2-4ac9-a75e-492deb797844","year":2022},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.638435Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:d2129be8f553cddf58cdd88b9d8332d5fe9676efc7fe46eae4274ea774a76e36","observation_id":"6424e198-e2c7-418c-86e2-855ccba0433c","resolution":{"observed_at":"2026-08-11T20:24:59.448624Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.425244Z","title":null,"venue":null,"work_id":"3e56ee32-4906-41ec-a94c-c9e983eb21b5","year":2022},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.652694Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:da517e9e27c39c98e6103ad805df47ca5035b261ff61006f42c6e25015f2ae0d","observation_id":"2a559d22-4788-4c81-b787-7c5fb0c10e7d","resolution":{"observed_at":"2026-08-11T20:24:59.431049Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.407897Z","title":null,"venue":null,"work_id":"f3f6bb59-f969-47a4-a457-a972f5d03cff","year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.658409Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:4111642201631ed35ea73a43725c420087b485d1f73ab491a914ccde95f27060","observation_id":"98814e1e-44ec-4f97-841f-6b14c74d8177","resolution":{"observed_at":"2026-08-11T20:24:59.413661Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:58.664257Z","title":"Lawrence Zitnick, and Devi Parikh","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.664257Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:ff4680546ac2901f9a7efc79a2803e0f77d34e6f31503c63afe7e97c6d15139b","observation_id":"3b4f40bd-4e49-4f1e-9203-9cec805033f2","resolution":{"observed_at":"2026-08-11T20:24:58.664257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.377956Z","title":"Kankanhalli, and Ying Shan","venue":null,"work_id":"5708c340-1f5b-48b8-8a77-d04e62c702cd","year":null},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.669366Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:1e2acd8282840332ac6d3803b261ce98ef75efa5765894cc1e123b03a3e1c148","observation_id":"661fd402-cf8b-4853-80bd-820896e41528","resolution":{"observed_at":"2026-08-11T20:24:59.383000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.358856Z","title":null,"venue":null,"work_id":"17831e47-996b-40d7-8e13-3fd0557c1f78","year":2024},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.680935Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:89990e0f26d1c309c65c0196853aeb747cd28e0c02fdeb71aaf8699c1691d31a","observation_id":"d15a06d4-e799-4897-a780-7458765aaaa4","resolution":{"observed_at":"2026-08-11T20:24:59.365071Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00582","last_updated":"2024-03-13T03:42:31Z","snapshot_observed_at":"2026-08-16T14:56:09.762264Z","submitted_at":"2023-10-01T05:53:15Z","title":"Pink: Unveiling the Power of Referential Comprehension for Multi-modal LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00582","snapshot_observed_at":"2026-08-11T20:24:58.685925Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.685925Z"},"links":{"cited_paper":"/paper/2310.00582","citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:189a24c5dc73e0e556282567173e09c5c50bca4d2024799bdb0ab2b026d35624","observation_id":"cb5ab899-8ab8-4bbd-ae0c-3ee6451b5a07","resolution":{"observed_at":"2026-08-11T20:24:58.685925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.341186Z","title":null,"venue":null,"work_id":"51853e03-4a05-4acc-80ed-1c165754f965","year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.691231Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:12a3621103fe18e61699fbd3882d66770d9d66ba0b7655c560815d595b3c3d92","observation_id":"fd484882-c148-41c8-b67d-40d76d1fa519","resolution":{"observed_at":"2026-08-11T20:24:59.346314Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12223","last_updated":"2023-05-23T10:35:35Z","snapshot_observed_at":"2026-08-16T15:31:28.364557Z","submitted_at":"2023-05-20T16:11:26Z","title":"What Makes for Good Visual Tokenizers for Large Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.12223","snapshot_observed_at":"2026-08-11T20:24:58.675146Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.675146Z"},"links":{"cited_paper":"/paper/2305.12223","citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:e66d90757c52720714f5ec1ca63b8fbd084302032edef52e85ed20e850888027","observation_id":"5f8b5b5d-3e08-4d43-bdc5-0879d0161b8f","resolution":{"observed_at":"2026-08-11T20:24:58.675146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.305305Z","title":"Ayyubi, Kai-Wei Chang, and Shih-Fu Chang","venue":null,"work_id":"51ebff24-7cff-4f4f-91a1-28d7d94fc77f","year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.700943Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:5eef309296bbb79c1b9346b0ffcd11978fb54368a5f60f51aab3790c5ed65023","observation_id":"fb334b67-d093-4dc0-8155-14073405c3bd","resolution":{"observed_at":"2026-08-11T20:24:59.310859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00653","last_updated":"2023-10-01T12:35:18Z","snapshot_observed_at":"2026-08-16T14:56:07.549747Z","submitted_at":"2023-10-01T12:35:18Z","title":"Reformulating Vision-Language Foundation Models and Datasets Towards Universal Multimodal Assistants","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00653","snapshot_observed_at":"2026-08-11T20:24:58.819520Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.819520Z"},"links":{"cited_paper":"/paper/2310.00653","citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:a46eb77eed9007bf61877c6cf06e9454ae1efd5094adb95ef91fb02b0f19434e","observation_id":"c745772d-88be-4c47-9f00-6d7516d1e0ac","resolution":{"observed_at":"2026-08-11T20:24:58.819520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.287956Z","title":null,"venue":null,"work_id":"84583251-fd96-4264-b10d-4fc88bf82512","year":2024},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.826900Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:ea8c0922ba9e9d461fc018858dd22446dc0a2641c396914f80f53d3fae0aa385","observation_id":"7ba0b754-53b1-4a16-bd0b-6fdd386e90ca","resolution":{"observed_at":"2026-08-11T20:24:59.293250Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.323517Z","title":null,"venue":null,"work_id":"64bc1e2b-538b-4a9e-b142-1c15d014f163","year":2021},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.696033Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:c5715d664301d5ade738dea1606cbce31caa9da8a82fbe0534e4a6a9db336c9f","observation_id":"67d6d895-47bf-4a39-88b2-db5422dea2cc","resolution":{"observed_at":"2026-08-11T20:24:59.328569Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-11T20:24:58.837882Z","title":"Diab, Xian Li, Xi Victoria Lin, Todor Mihaylov, Myle Ott, Sam Shleifer, Kurt Shuster, Daniel Simig, Punit Singh Koura, Anjali Sridhar, Tianlu Wang, and Luke Zettlemoyer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.837882Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:ce783addae0280b01797a0574b1abc00ac41d9e31608d868b3fcb4ef79381bfd","observation_id":"84d5fe19-58d6-4f46-b6a7-9cd03a16486e","resolution":{"observed_at":"2026-08-11T20:24:58.837882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03601","last_updated":"2025-06-12T00:15:18Z","snapshot_observed_at":"2026-08-16T15:17:57.366511Z","submitted_at":"2023-07-07T13:43:44Z","title":"GPT4RoI: Instruction Tuning Large Language Model on Region-of-Interest","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03601","snapshot_observed_at":"2026-08-11T20:24:58.844630Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.844630Z"},"links":{"cited_paper":"/paper/2307.03601","citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:03ca586fb7dacae80fc351835bdf730833343a075478ccb9e4bcb60653cfb414","observation_id":"a16ae891-0baf-4145-8f8e-0a7d0392063d","resolution":{"observed_at":"2026-08-11T20:24:58.844630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:58.850385Z","title":"Weinberger, and Yoav Artzi","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.850385Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:38a34296977084c57b10543c1227793ff09d33c75e85a06c5c9ae12097164178","observation_id":"d0c59df3-acdc-4d25-ac16-82ea52769aa5","resolution":{"observed_at":"2026-08-11T20:24:58.850385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.271196Z","title":null,"venue":null,"work_id":"7ceb042d-d0dc-4062-92bf-4324b2df9a0e","year":2019},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.832063Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:c4884c10eca7a261c5b3ad1a998838be4d2137807b7927b7000ed963a2ed88d3","observation_id":"826fa3e5-5fbf-4389-a03a-10c4e5a07c94","resolution":{"observed_at":"2026-08-11T20:24:59.276307Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-11T20:24:58.878977Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.878977Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:12324ab6e0ca42412f92ccab443c9f933dd6aee90eb556b6c8630e6322b3c81e","observation_id":"73dd64b0-0ded-4a0d-aac0-6bdf35f7e186","resolution":{"observed_at":"2026-08-11T20:24:58.878977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.230961Z","title":null,"venue":null,"work_id":"3049a0e3-e059-47e8-bf43-e48146b900eb","year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.872814Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:1b0ef6bf8b6a0fa78d339e9f4ffb0dea2f05af630404ccc76c6d3464e65a074c","observation_id":"994332af-eec7-4c7e-a971-0961649be99b","resolution":{"observed_at":"2026-08-11T20:24:59.236382Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.718213Z","title":null,"venue":null,"work_id":"04d21361-c063-4a53-b47c-e8813e96bb25","year":null},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.509413Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:3ab0bf4ac401bef0394d83c6b6ac7073cb01ac1fa2c6149f3154902c152f9582","observation_id":"af7f7e36-a677-412c-8066-db74d0dc4c62","resolution":{"observed_at":"2026-08-11T20:24:59.723819Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.524746Z","title":null,"venue":null,"work_id":"fdea57a0-7db0-4367-b43f-3dfd338bf642","year":null},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.601703Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:a3067c636480c7b34ad456b6a2b347477fdcf7c2d9429f19a6af2ea600338389","observation_id":"ad44c32a-daef-4099-b1aa-4ca1aceebf03","resolution":{"observed_at":"2026-08-11T20:24:59.530414Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:58.866954Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.866954Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:36a7774a72e65c8f5f08b03b9009a91f14c66c075cc9539a7a59c7742aa16671","observation_id":"8149cf16-f880-48be-9d9e-419465951581","resolution":{"observed_at":"2026-08-11T20:24:58.866954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14565","last_updated":"2024-03-19T22:53:25Z","snapshot_observed_at":"2026-08-15T23:41:03.981699Z","submitted_at":"2023-06-26T10:26:33Z","title":"Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14565","snapshot_observed_at":"2026-08-11T20:24:58.572985Z","title":"CoRR abs/2306.14565 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.572985Z"},"links":{"cited_paper":"/paper/2306.14565","citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:126e75e084951e4b867cdda79746d7b77f32686ceeb694c8047e2b05ace9f342","observation_id":"4719f194-a45e-48b3-b66b-7c09617c7783","resolution":{"observed_at":"2026-08-11T20:24:58.572985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T08:22:32.475723Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":54,"verified_exact":1,"verified_fuzzy":4},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 0 inbound Pith citation observations for arXiv:2412.07801."}