{"as_of":"2026-08-14T06:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5e6e3c669bc7ab8442af2868040086e010b7767de4becd65e2d1637bf4adcc94","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T16:56:11.028503Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T06:28:45.967569Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13053","snapshot_observed_at":"2026-08-03T06:28:45.967569Z","title":"Megl: Multimodal explanation-guided learning.arXiv preprint arXiv:2411.13053,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07008","last_updated":"2026-07-20T11:10:30Z","snapshot_observed_at":"2026-08-03T23:15:33.062867Z","submitted_at":"2026-01-30T10:29:27Z","title":"Where Not to Learn: Prior-Aligned Training with Subset-based Attribution Constraints for Reliable Decision-Making","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T06:28:45.967569Z"},"links":{"cited_paper":"/paper/2411.13053","citing_paper":"/paper/2602.07008"},"observation_digest":"sha256:57cbe4bfa1d6aec22d79f6341a5fc0943212614d5d46bce0d01220f18df26c8e","observation_id":"59674582-494d-4957-a588-f117f2b3c38e","resolution":{"observed_at":"2026-08-03T06:28:45.967569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.13053/citation-record","integrity":"/paper/2411.13053/integrity","json":"/paper/2411.13053/citation-record.json","paper":"/paper/2411.13053"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T16:56:10.660284Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.660284Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:10e844311b05e6d751ed537854417ed049b281cd537fd4a5360e51511e328bda","observation_id":"15353b77-9544-449e-a4cb-8f1c24276c75","resolution":{"observed_at":"2026-08-12T16:56:10.660284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:12.277244Z","title":"Tbexplain: A text-based explanation method for scene classification models with the statistical prediction correction","venue":null,"work_id":"1607635b-0979-4ae3-94e2-6d6133a2325a","year":2024},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.666878Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:b2856ab71bef532c10fc45dd1f45a0b0c193c9ca4c3b00045668783155eeebd6","observation_id":"7bc41f5c-d495-4dd5-b73c-28586f8d5158","resolution":{"observed_at":"2026-08-12T16:56:12.283009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:10.672926Z","title":"Spice: Semantic propositional image cap- tion evaluation","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.672926Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:241a5597becdc942d7e847abd095dc8b75edb1ab83d2355bdb8a440919b9d22a","observation_id":"c2879fd1-ee4f-4a37-9ce1-23997739be21","resolution":{"observed_at":"2026-08-12T16:56:10.672926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-12T16:56:10.678779Z","title":"Gemini: A family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.678779Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:95f6ecfd953fc953be9bd27adecaee1a1110da0ee97e728b2fd73da253d9713d","observation_id":"85ae0cc5-ccd5-4c48-8a86-e94b200db6ec","resolution":{"observed_at":"2026-08-12T16:56:10.678779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:12.245933Z","title":"Explainable artificial intelligence (xai): Concepts, taxonomies, opportunities and challenges toward responsible ai","venue":null,"work_id":"cf3aeae6-acb8-4417-ba26-3948321a97f1","year":2020},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.684903Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:08e69dff32bda0ca361ba83cddfeb91f5f8c8851d73eaa3bbf531f2a8bb6ef50","observation_id":"7cbe616d-b9f4-492e-8ad3-60cf4d072cb0","resolution":{"observed_at":"2026-08-12T16:56:12.251668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:10.690613Z","title":"Meteor: An automatic metric for mt evaluation with improved correlation with hu- man judgments","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.690613Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:56d091bb9eed8ba1c4e3f0e4c699dcac22dfc42593e2c778c8a905ec79580a57","observation_id":"899117b8-c0e6-4a98-bbd2-124306b764f5","resolution":{"observed_at":"2026-08-12T16:56:10.690613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:10.696412Z","title":"Let there be a clock on the beach: Reducing object halluci- nation in image captioning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.696412Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:b7775018104a555ce23beee61aee0fa88037d4458d37fa9b9d4787206715f784","observation_id":"c13859aa-b564-466c-bdb5-1a309aa9c406","resolution":{"observed_at":"2026-08-12T16:56:10.696412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:12.198893Z","title":"A survey on xai and nat- ural language explanations","venue":null,"work_id":"25b69b51-fd72-46ea-b779-470dd57e6f02","year":2023},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.702334Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:e3bcbea42b0f3c3e7b6c09f0384cc38b3ad21fad95ffd336b02c53e124adad9e","observation_id":"47983ac8-7e1d-4da0-8261-7d561c1babbe","resolution":{"observed_at":"2026-08-12T16:56:12.205236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:12.181675Z","title":"Machine learning interpretability: A survey on methods and metrics","venue":null,"work_id":"c44afa7b-4b41-4eb6-987c-e5ecf86c22ec","year":2019},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.708048Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:6e7b2536c79983c8430d65a70cc0a066f1b12a3efa11ddcbc2bc3bad77676c53","observation_id":"146450f3-937b-4809-8650-eb4620a0957f","resolution":{"observed_at":"2026-08-12T16:56:12.187087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-12T16:56:10.714945Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.714945Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:c16a0a4d9571a1e2fc619720a434ac0fa141e62e949062fdae7bb8ad3234ba9f","observation_id":"037c5f3f-1d90-41af-b474-af404cbb615f","resolution":{"observed_at":"2026-08-12T16:56:10.714945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:12.153909Z","title":"Techniques for in- terpretable machine learning","venue":null,"work_id":"2cae9d71-606a-4b91-a8a1-77b341fd2af8","year":2019},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.721914Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:2a6ce888181c609a247067c59e543bbbaeebf3dea82f2b118d26d4f2e91e6fca","observation_id":"81534ad3-e0c2-4a00-96fd-896ba1c66cc3","resolution":{"observed_at":"2026-08-12T16:56:12.162112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:12.130099Z","title":"Learn- ing credible deep neural networks with rationale regulariza- tion","venue":null,"work_id":"d0f55371-9bb1-4eca-b846-e55ff01838b9","year":2019},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.727380Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:2dbce72236d9f6b2f7f686620c2a37d7b972f12b5dd33fbd57f6a6ebf4d3ee61","observation_id":"5c894918-599e-46b5-b109-6de32f0c9d50","resolution":{"observed_at":"2026-08-12T16:56:12.137278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:12.107559Z","title":"Attention branch network: Learning of attention mechanism for visual explanation","venue":null,"work_id":"09008c72-0783-49bc-8615-c3652f95ba1b","year":2019},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.734558Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:37bc5a28f5906b1f751dec2b806a7d3d52d0bf2f0bef2d96f6e2e2a5123d7218","observation_id":"2b78c56b-0dac-48a6-897f-7cd57aa8e746","resolution":{"observed_at":"2026-08-12T16:56:12.113801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:12.086612Z","title":"Res: A robust framework for guiding visual explanation","venue":null,"work_id":"80ce47dd-18fd-4cb3-89ad-958f7c5ea11d","year":2022},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.742038Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:5256ab7e37b5043c2ddeef5935770e4e88ae3cb803c053495dee7bfae6b0151c","observation_id":"56e56819-2781-4067-adbc-30e54b80ca64","resolution":{"observed_at":"2026-08-12T16:56:12.092452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:12.062457Z","title":"Going beyond xai: A system- atic survey for explanation-guided learning","venue":null,"work_id":"da17658e-8d8d-49e5-ba97-75b15e5ce7c6","year":2024},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.748124Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:c00604928181d71b45f3171db44ae68b44afcd4fc08cdb86487bc6cb87e60d1e","observation_id":"1dcb86e1-9f93-434b-8216-1e828afeccba","resolution":{"observed_at":"2026-08-12T16:56:12.069196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04719","last_updated":"2024-06-06T18:05:40Z","snapshot_observed_at":"2026-08-13T11:22:21.005298Z","submitted_at":"2023-06-07T18:31:39Z","title":"Don't trust your eyes: on the (un)reliability of feature visualizations","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04719","snapshot_observed_at":"2026-08-12T16:56:10.753790Z","title":"Don’t trust your eyes: on the (un) reliability of feature visualizations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.753790Z"},"links":{"cited_paper":"/paper/2306.04719","citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:68d0b0fbfcb68616ec710d4da740deb596c184bc0cf8f05989b0e8f482ae5937","observation_id":"98b98a3c-287c-483d-b648-635f1c4001c6","resolution":{"observed_at":"2026-08-12T16:56:10.753790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:12.039152Z","title":"Essa: Explanation iterative supervision via saliency-guided data augmentation","venue":null,"work_id":"b611a0b7-c1d1-49ff-a404-5c46d93a66bf","year":2023},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.759684Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:397b60415e8dbb59d9fc4f744d8a10f9839cf53b6003f7b7cce297ac7de020a8","observation_id":"2adce892-e148-4d9e-8697-cc188f5c7927","resolution":{"observed_at":"2026-08-12T16:56:12.047347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00189","last_updated":"2023-10-31T23:24:22Z","snapshot_observed_at":"2026-08-13T05:35:20.435753Z","submitted_at":"2023-10-31T23:24:22Z","title":"XAI-CLASS: Explanation-Enhanced Text Classification with Extremely Weak Supervision","version":1},"cited_work":{"arxiv_id":"2311.00189","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.00189","snapshot_observed_at":"2026-08-12T16:56:11.461258Z","title":"XAI-CLASS: Explanation-Enhanced Text Classification with Extremely Weak Supervision","venue":"cs.CL","work_id":"118cb384-ba10-4e41-a840-8947a9628c9d","year":2023},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.765942Z"},"links":{"cited_paper":"/paper/2311.00189","citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:488be05df70e6321452d5ef897052dd70ad2e9a5bff5ae49f1e32fe250b29776","observation_id":"59d4c10b-5fa6-4c89-8878-19e29c5c76f5","resolution":{"observed_at":"2026-08-12T16:56:11.467685Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03961","last_updated":"2024-09-06T00:59:10Z","snapshot_observed_at":"2026-08-12T23:50:47.726454Z","submitted_at":"2024-09-06T00:59:10Z","title":"Generating Faithful and Salient Text from Multimodal Data","version":1},"cited_work":{"arxiv_id":"2409.03961","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.03961","snapshot_observed_at":"2026-08-12T16:56:11.433309Z","title":"Generating Faithful and Salient Text from Multimodal Data","venue":"cs.CV","work_id":"3d712da1-2080-4ab3-8219-37f9df3dbdd6","year":2024},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.771646Z"},"links":{"cited_paper":"/paper/2409.03961","citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:a735c9dec0f6298dd58814e76c656e4a4dd073eebb8186f97b692ba11d1948d1","observation_id":"4a7d89d4-2ae6-44bd-b453-e73740ec871f","resolution":{"observed_at":"2026-08-12T16:56:11.439452Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:12.016842Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"c86591f9-54f5-487d-8592-4b265266eb58","year":2016},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.777520Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:b3f9819370b94d6a7c17c62203e810d087afd32d96154ba613f32e8640bd9d73","observation_id":"e8d0caaf-df93-42d4-82a6-ad7854bcfee4","resolution":{"observed_at":"2026-08-12T16:56:12.024021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:11.998199Z","title":"Generating vi- sual explanations","venue":null,"work_id":"d1829a81-7f88-49a0-abfa-3c83d0e6cdd9","year":2016},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.783772Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:c31401c9450bfbed5a09b0ff88a2c5b8069e7dec3fcf807ce8cfaac3623e1354","observation_id":"602e1ae9-3e55-452f-9dc1-5b8b856d4ebf","resolution":{"observed_at":"2026-08-12T16:56:12.003327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-12T16:56:10.790044Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.790044Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:81c916ead5f784962605f487b5e9121aa758016b6cf7d0961c5b7ba1255bd9d5","observation_id":"ebc38e85-ddbb-421a-9b7f-b89d83ba596a","resolution":{"observed_at":"2026-08-12T16:56:10.790044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10071","last_updated":"2023-06-13T10:55:29Z","snapshot_observed_at":"2026-08-13T13:18:22.882788Z","submitted_at":"2022-12-20T08:24:45Z","title":"Large Language Models Are Reasoning Teachers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10071","snapshot_observed_at":"2026-08-12T16:56:10.796057Z","title":"Large language models are reasoning teachers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.796057Z"},"links":{"cited_paper":"/paper/2212.10071","citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:fec0113855e4ec693743718a8df13cbb73e14fa2ef8bfb1defac2c49d3c43c4c","observation_id":"6f254c4a-8c19-4c69-94de-478503745cfa","resolution":{"observed_at":"2026-08-12T16:56:10.796057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-12T16:56:10.802153Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.802153Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:a76efb2655e3a55b83cb4b5aad05fa3282b3c27579ecce38a7fd9b545a61f776","observation_id":"4040d0eb-80ed-45ee-9dec-41b38168d5b6","resolution":{"observed_at":"2026-08-12T16:56:10.802153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:11.980406Z","title":"Bliva: A simple multimodal llm for better handling of text-rich visual questions","venue":null,"work_id":"20df2e56-f427-46b7-be1a-3c71601b6da1","year":2024},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.808892Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:665d104f9a61998455f8626e6e23b63d01a090277a3266a0dfcd46bb84241cf6","observation_id":"a1f7f630-1207-4b51-856b-69c96ac39fa8","resolution":{"observed_at":"2026-08-12T16:56:11.985871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:10.815283Z","title":"Survey of hallucination in natural language generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.815283Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:56c2699e6b39dc7b1591249f8b03a3bfac773157cea05ba18813017fc2fed855","observation_id":"3eae2815-0a6b-4f7d-a3dc-bdc6484c5a4d","resolution":{"observed_at":"2026-08-12T16:56:10.815283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:10.821291Z","title":"Hallucination augmented contrastive learn- ing for multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.821291Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:3195838aba9d5a402775412f6bf320a514b2ae64f5a4a9ffaddc7dca797b1f42","observation_id":"3ed97673-8634-4388-83d0-6c2f2545e45b","resolution":{"observed_at":"2026-08-12T16:56:10.821291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:10.826822Z","title":"Deep learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.826822Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:c5088fd57b6f2987c732f5be4bc08855c5d106d61787a418c831ec3549dfb6c3","observation_id":"6a51ba39-de51-4193-b766-2d78bd219634","resolution":{"observed_at":"2026-08-12T16:56:10.826822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:10.834757Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.834757Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:5f036160d2db43f9056f3821b97685b598c333474719a4676221ffe6d35a9323","observation_id":"83afcede-b744-43ed-9f0e-210b7b8556ca","resolution":{"observed_at":"2026-08-12T16:56:10.834757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14050","last_updated":"2024-04-15T21:58:27Z","snapshot_observed_at":"2026-08-13T11:10:03.254684Z","submitted_at":"2023-06-24T20:15:07Z","title":"Symbolic Chain-of-Thought Distillation: Small Models Can Also \"Think\" Step-by-Step","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14050","snapshot_observed_at":"2026-08-12T16:56:10.840711Z","title":"Symbolic chain-of-thought distillation: Small models can also” think” step-by-step","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.840711Z"},"links":{"cited_paper":"/paper/2306.14050","citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:990ac40cd03288833a6381cf9d7375bd04c91b74ec9ae750a00d9b52c536655f","observation_id":"122bbb4a-7801-47f5-9096-3a3bda804545","resolution":{"observed_at":"2026-08-12T16:56:10.840711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:11.890868Z","title":"Vqa-e: Explaining, elaborating, and enhancing your answers for visual questions","venue":null,"work_id":"b94e0c51-6eb6-47d1-a23a-ce8cd953177c","year":2018},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.848190Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:8b0f2cbe87a459eec06c15ab2763788cd44f5cc8505dc3c827b609a0de0b5d00","observation_id":"df77f620-7aea-43c3-b353-2b6e26c8d8fb","resolution":{"observed_at":"2026-08-12T16:56:11.897684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06726","last_updated":"2022-10-13T04:50:02Z","snapshot_observed_at":"2026-08-13T14:06:58.914750Z","submitted_at":"2022-10-13T04:50:02Z","title":"Explanations from Large Language Models Make Small Reasoners Better","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.06726","snapshot_observed_at":"2026-08-12T16:56:10.853956Z","title":"Explanations from large language models make small reasoners better","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.853956Z"},"links":{"cited_paper":"/paper/2210.06726","citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:f8e2caa4cd21ba8a7dd244166a194f4f77297af47b10354547d986618c073205","observation_id":"9e4357b6-e46c-4471-9d75-c0509a676a57","resolution":{"observed_at":"2026-08-12T16:56:10.853956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:10.859671Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.859671Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:53223f3d09f3a2fb7418805d4bdfe260294736bcd98def25599ec2577063d743","observation_id":"22fa143a-0efc-4d6e-bb66-03f38bea3a63","resolution":{"observed_at":"2026-08-12T16:56:10.859671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:10.865125Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.865125Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:6e84305af1b4d6b30c2a20946eb3eba79c98f6c620d3ab3f9ff331472d834800","observation_id":"76fc5d5c-7857-4505-be5f-ac1d1a78d020","resolution":{"observed_at":"2026-08-12T16:56:10.865125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.07874","last_updated":"2017-11-25T03:53:32Z","snapshot_observed_at":"2026-07-06T05:43:42.722222Z","submitted_at":"2017-05-22T17:38:10Z","title":"A Unified Approach to Interpreting Model Predictions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.07874","snapshot_observed_at":"2026-08-12T16:56:10.870584Z","title":"A unified approach to interpreting model predictions","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.870584Z"},"links":{"cited_paper":"/paper/1705.07874","citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:83c305a2de12891deff5b5bdc9b11e168c87d4346d85b06c084e26b55fd2171f","observation_id":"6052a327-dbc4-4348-9e1d-73070e0366ab","resolution":{"observed_at":"2026-08-12T16:56:10.870584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08410","last_updated":"2023-06-01T12:17:01Z","snapshot_observed_at":"2026-08-13T13:20:10.775616Z","submitted_at":"2022-12-16T11:24:42Z","title":"Teaching Small Language Models to Reason","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08410","snapshot_observed_at":"2026-08-12T16:56:10.876678Z","title":"Teach- ing small language models to reason","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.876678Z"},"links":{"cited_paper":"/paper/2212.08410","citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:eb984a4467b81891d6793366368716721aa5ef26c4db83ee1405566c215945c9","observation_id":"56ec39f9-2eb3-41e4-a6e5-82335b3ca43f","resolution":{"observed_at":"2026-08-12T16:56:10.876678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.07526","last_updated":"2020-10-15T05:08:56Z","snapshot_observed_at":"2026-08-13T21:19:45.753388Z","submitted_at":"2020-10-15T05:08:56Z","title":"Natural Language Rationales with Full-Stack Visual Reasoning: From Pixels to Semantic Frames to Commonsense Graphs","version":1},"cited_work":{"arxiv_id":"2010.07526","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.07526","snapshot_observed_at":"2026-08-12T16:56:11.261608Z","title":"Natural Language Rationales with Full-Stack Visual Reasoning: From Pixels to Semantic Frames to Commonsense Graphs","venue":"cs.CL","work_id":"54c9620a-1a33-4f93-bc61-f74633c073cb","year":2020},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.883474Z"},"links":{"cited_paper":"/paper/2010.07526","citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:d4b37fb64b3347f92b3f4c6adfeee531e1825ca4fb08bb4482bf259aac7e2eed","observation_id":"1e715a4a-d54c-47a3-bfcb-b2e6ff77c77d","resolution":{"observed_at":"2026-08-12T16:56:11.267610Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12808","last_updated":"2024-08-23T03:02:11Z","snapshot_observed_at":"2026-08-13T12:35:01.532030Z","submitted_at":"2024-08-23T03:02:11Z","title":"VALE: A Multimodal Visual and Language Explanation Framework for Image Classifiers using eXplainable AI and Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12808","snapshot_observed_at":"2026-08-12T16:56:10.890450Z","title":"Vale: A mul- timodal visual and language explanation framework for im- age classifiers using explainable ai and language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.890450Z"},"links":{"cited_paper":"/paper/2408.12808","citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:1b9d0e0e1fa6e4698ae611b6f29fe3112808cac0603aaf788a2722052f9bd36f","observation_id":"c352a93d-f575-4683-8bf0-48133222af74","resolution":{"observed_at":"2026-08-12T16:56:10.890450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:10.896773Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.896773Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:9e8eec86d97fabb80b45dde9619c35a6cfd14ab51d3b0631fba720c9fd150c4a","observation_id":"30dbf13b-3c89-4e29-9d18-8e048b0419ca","resolution":{"observed_at":"2026-08-12T16:56:10.896773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:11.832934Z","title":"Multimodal explanations: Justifying deci- sions and pointing to the evidence","venue":null,"work_id":"6938e9b0-7adf-4c35-8991-e0baf66db7a3","year":2018},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.902344Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:1fb49d621dd701c95be0665bc5833336f4b015f61a96c012571239d9a1fcbcf4","observation_id":"13fe9371-f332-4959-a8b8-41f54d512a0b","resolution":{"observed_at":"2026-08-12T16:56:11.842324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:11.813416Z","title":"Ro- bust explanations for visual question answering","venue":null,"work_id":"f8a50420-5ccf-4f90-9239-9858b0028d25","year":2020},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.909821Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:acf5ee5ad5522a2f74417425d3b75cdbee932ef73ad66f9db10c71dde260b0f8","observation_id":"c40bf59f-cab8-4229-a7bd-67ad88f0e56d","resolution":{"observed_at":"2026-08-12T16:56:11.819499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.07421","last_updated":"2018-09-25T18:16:18Z","snapshot_observed_at":"2026-08-13T09:24:19.606375Z","submitted_at":"2018-06-19T18:41:30Z","title":"RISE: Randomized Input Sampling for Explanation of Black-box Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.07421","snapshot_observed_at":"2026-08-12T16:56:10.916178Z","title":"Rise: Randomized input sampling for explana- tion of black-box models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.916178Z"},"links":{"cited_paper":"/paper/1806.07421","citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:9c773ec9dd9671043cf6e305e60293ff5d75031966945f1d0c83841b86c198ce","observation_id":"95c2a448-9cdd-4635-a578-3b026d7ae609","resolution":{"observed_at":"2026-08-12T16:56:10.916178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:10.922390Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.922390Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:39e13e783d4751228ad323ef9af4ed793c1da51413fe6eab20897fa4b3f8d939","observation_id":"fc169658-621c-4730-a695-2163b296de94","resolution":{"observed_at":"2026-08-12T16:56:10.922390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.02626","last_updated":"2021-04-29T00:36:17Z","snapshot_observed_at":"2026-08-14T00:36:02.315358Z","submitted_at":"2021-04-29T00:36:17Z","title":"A First Look: Towards Explainable TextVQA Models via Visual and Textual Explanations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.02626","snapshot_observed_at":"2026-08-12T16:56:10.927640Z","title":"A first look: Towards explainable textvqa models via visual and textual explanations","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.927640Z"},"links":{"cited_paper":"/paper/2105.02626","citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:f54a15d3ebe8d7947cb3f67f22f4c511bd47e7f292262b60c6094be7eb041b95","observation_id":"b20adb0b-4d6c-44ad-aa25-2dea72338326","resolution":{"observed_at":"2026-08-12T16:56:10.927640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:11.778479Z","title":"Interpretations are useful: penalizing explanations to align neural networks with prior knowledge","venue":null,"work_id":"95d3d72b-2c9a-4864-bc2b-7fb17fbd3b50","year":null},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.934197Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:d6188ea8ab30425440f3f5fcdd908e4505498ed4a778fe0711044ad262645eb6","observation_id":"a2f4a05d-5fc4-444a-8401-7d5effe0365a","resolution":{"observed_at":"2026-08-12T16:56:11.784062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.07450","last_updated":"2017-01-25T16:33:29Z","snapshot_observed_at":"2026-08-07T01:29:08.076157Z","submitted_at":"2016-11-22T18:34:36Z","title":"Grad-CAM: Why did you say that?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.07450","snapshot_observed_at":"2026-08-12T16:56:10.939679Z","title":"Grad-cam: Why did you say that? arXiv preprint arXiv:1611.07450, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.939679Z"},"links":{"cited_paper":"/paper/1611.07450","citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:d902b1bb2db8e27eb3902c5886e44125529f2b873bb059a1c940aecdf45d1806","observation_id":"4e6b52c1-2b6f-4c3d-81fb-1679a94ef007","resolution":{"observed_at":"2026-08-12T16:56:10.939679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:11.755854Z","title":"10 Grad-cam: Visual explanations from deep networks via gradient-based localization","venue":null,"work_id":"26056930-abac-4a00-b1a8-218c35372701","year":null},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.945055Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:82261d45aa3dcbc1469bc56ddfe5be884c8adec45cd5ed5667f4fb6344d19c6d","observation_id":"26b83f98-3f27-4dd7-a827-dc7ff3e54edd","resolution":{"observed_at":"2026-08-12T16:56:11.764337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:11.730703Z","title":"Human-ai interactive and continuous sensemaking: A case study of image classification using scribble attention maps","venue":null,"work_id":"d12a7df3-e018-4b21-ad38-f98fc2a92c41","year":2021},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.950683Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:5e7a773840f0210e894c44df8be462dd1308f1300cf1bd18b736af3fc8571eb5","observation_id":"0a306b1d-06ae-4e15-9e91-67bf3d10a69c","resolution":{"observed_at":"2026-08-12T16:56:11.738853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:11.706957Z","title":"A review of taxonomies of explainable ar- tificial intelligence (xai) methods","venue":null,"work_id":"bf494bd4-73e4-4600-99ac-f4f30b26126d","year":2022},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.955766Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:cf1097e12215356e9d1b2a9d77c190fb43174867bff3ccb8c388eba5dbeabb82","observation_id":"ea4f856a-b39e-4fa9-8f67-64adee87dcbd","resolution":{"observed_at":"2026-08-12T16:56:11.715500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:10.961575Z","title":"Axiomatic attribution for deep networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.961575Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:6868c25d0a2c9e5272f35759bc39cdb6536a0dc8dc0df0cb8644e7cbba2bae61","observation_id":"47b93eac-a449-49e2-86ea-6d7f6c393203","resolution":{"observed_at":"2026-08-12T16:56:10.961575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.12152","last_updated":"2019-09-09T08:09:25Z","snapshot_observed_at":"2026-08-12T23:53:39.680490Z","submitted_at":"2018-05-30T18:00:32Z","title":"Robustness May Be at Odds with Accuracy","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.12152","snapshot_observed_at":"2026-08-12T16:56:10.967542Z","title":"Robustness may be at odds with accuracy","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.967542Z"},"links":{"cited_paper":"/paper/1805.12152","citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:f1174096f88962ede42ac1a92c43ca78acc5231ee594143a8eaeae4f2810bee7","observation_id":"5d3324e8-4fbf-4783-9765-740e1caff284","resolution":{"observed_at":"2026-08-12T16:56:10.967542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:11.669257Z","title":"Explainable artificial intel- ligence (xai) in deep learning-based medical image analysis","venue":null,"work_id":"d6c2bdaa-4838-4d6f-97e0-9766b69cf4d8","year":2022},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.973194Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:b344e660fc7048d5f6fcd392d7f113a49f998be04296da45b3e924734ba8c436","observation_id":"4f7ba613-df0a-45b4-b7a7-b434be152d0b","resolution":{"observed_at":"2026-08-12T16:56:11.676349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:10.978628Z","title":"Cider: Consensus-based image description evalua- tion","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.978628Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:9a3ecfcd7bb4485481631502be8988ecff692acf3487670219d14cae7d269f18","observation_id":"e5034e88-8d5f-4f70-abd9-e7aa8747268a","resolution":{"observed_at":"2026-08-12T16:56:10.978628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02805","last_updated":"2019-06-03T19:54:15Z","snapshot_observed_at":"2026-08-12T23:50:48.108024Z","submitted_at":"2018-09-08T14:14:03Z","title":"Faithful Multimodal Explanation for Visual Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.02805","snapshot_observed_at":"2026-08-12T16:56:10.983765Z","title":"Faithful multimodal explanation for visual question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.983765Z"},"links":{"cited_paper":"/paper/1809.02805","citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:f2823261b3882842136b70e6c53f858209cc883b26b55cbf84066b42e4e29f7c","observation_id":"ee4ee791-962b-4d0f-942f-74020e33c9b6","resolution":{"observed_at":"2026-08-12T16:56:10.983765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:11.639410Z","title":"Generating deep networks explanations with ro- bust attribution alignment","venue":null,"work_id":"813a62ec-367f-4810-9f72-7663f6c938aa","year":2021},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.989040Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:3e82a4ca0ffe61cc95465e0ebf3fa732762e4be3c03a92a414f327c1133a219f","observation_id":"22389f54-2720-41f5-87f6-600ed372e1df","resolution":{"observed_at":"2026-08-12T16:56:11.645013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:11.615330Z","title":"Overlooked trustworthiness of saliency maps","venue":null,"work_id":"62d4a96c-25b8-484f-8183-b8990ee223e1","year":2022},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.994196Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:46e7a00ba1381a7f8da1ec06dd33e62c39371573229d92fb1973311b0be9149c","observation_id":"3385db47-7dfb-4201-9f7f-fa0d384329c2","resolution":{"observed_at":"2026-08-12T16:56:11.625479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:11.595444Z","title":"Rationale- augmented convolutional neural networks for text classifica- tion","venue":null,"work_id":"c7b8b3c7-4ea1-4b7f-ba79-bf78f76fb5fd","year":2016},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.999277Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:63ffb8c7518a46e0604c30037edae5f065311e25c8fef6c7454d9ddbe49a256f","observation_id":"9009f5c6-94ed-4024-a78b-d3704f8243e8","resolution":{"observed_at":"2026-08-12T16:56:11.602286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:11.572734Z","title":"Magi: Multi-annotated explanation-guided learning","venue":null,"work_id":"ca552cc9-42d3-4323-a0da-1b86101d4440","year":1977},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:11.004590Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:584308f220468cce3d3b516c80cd0c976e2adb3b547d16229e5976945f565ee8","observation_id":"7a6b2583-3e64-4014-bb1e-e766050e673c","resolution":{"observed_at":"2026-08-12T16:56:11.580092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-08-11T00:52:12.225793Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-12T16:56:11.010184Z","title":"Multimodal chain-of- thought reasoning in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:11.010184Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:59142d25d177d0f78883d636a645e84fec3d46e7bf93b5776944eea4880d7975","observation_id":"8bf2ff17-5b71-4991-baa1-284d17bae969","resolution":{"observed_at":"2026-08-12T16:56:11.010184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.06985","last_updated":"2024-10-04T05:00:24Z","snapshot_observed_at":"2026-08-13T05:27:29.124242Z","submitted_at":"2023-11-12T23:14:43Z","title":"Large Language Models are In-context Teachers for Knowledge Reasoning","version":3},"cited_work":{"arxiv_id":"2311.06985","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.06985","snapshot_observed_at":"2026-08-12T16:56:11.094809Z","title":"Large Language Models are In-context Teachers for Knowledge Reasoning","venue":"cs.CL","work_id":"39699ff5-757f-47ce-af81-3f0f04a11b90","year":2023},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:11.016101Z"},"links":{"cited_paper":"/paper/2311.06985","citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:b9333c6cbf72e5057d1b241b3ba4bf45c485b20dfb9ff0b7087ab20693faf3e0","observation_id":"e1490300-7fa8-440c-8905-86b3073586b7","resolution":{"observed_at":"2026-08-12T16:56:11.102813Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:11.022673Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena.Advances in Neural Information Processing Systems, 36:46595–46623, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:11.022673Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:1bb8866466fdbff14ea142fd4af5f683b748abcfca9b69dfd42db95d18b8c151","observation_id":"7c2640ea-c721-494c-ad29-d2389b7c5fed","resolution":{"observed_at":"2026-08-12T16:56:11.022673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00754","last_updated":"2024-03-16T19:28:08Z","snapshot_observed_at":"2026-08-13T00:44:34.883184Z","submitted_at":"2023-10-01T18:10:53Z","title":"Analyzing and Mitigating Object Hallucination in Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00754","snapshot_observed_at":"2026-08-12T16:56:11.028503Z","title":"Analyzing and mitigating object hallucination in large vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:11.028503Z"},"links":{"cited_paper":"/paper/2310.00754","citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:52c0366d5352bdeae87b0613c7a5a4032298fcb1e90b6423df3f46c0ba45f480","observation_id":"17642f7c-15d3-42c4-8bf7-dba8934526a6","resolution":{"observed_at":"2026-08-12T16:56:11.028503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T07:40:26.980776Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":4,"verified_fuzzy":25},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 1 inbound Pith citation observation for arXiv:2411.13053."}