{"as_of":"2026-08-17T23:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a281d70c9af1c5f55b7f7fc56d29a699b889268562f1eda10d06e50874bef274","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:55:28.327964Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.00150/citation-record","integrity":"/paper/2505.00150/integrity","json":"/paper/2505.00150/citation-record.json","paper":"/paper/2505.00150"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:55:29.136098Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":"4ca81f46-ed86-424f-b9b4-a7f4814d551f","year":2022},"citing_paper":{"arxiv_id":"2505.00150","last_updated":"2025-04-30T19:48:12Z","snapshot_observed_at":"2026-08-17T21:50:16.587671Z","submitted_at":"2025-04-30T19:48:12Z","title":"Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T04:55:28.088787Z"},"links":{"citing_paper":"/paper/2505.00150"},"observation_digest":"sha256:b4ea79c89579b20bafc708f1a680eb634a553ed77da9c21edb2a40cd8ba60b37","observation_id":"27a3026c-8019-4ea1-8265-bac079e7f749","resolution":{"observed_at":"2026-08-16T04:55:29.141780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-16T04:55:28.095027Z","title":"Openflamingo: An open- source framework for training large autoregressive vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00150","last_updated":"2025-04-30T19:48:12Z","snapshot_observed_at":"2026-08-17T21:50:16.587671Z","submitted_at":"2025-04-30T19:48:12Z","title":"Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T04:55:28.095027Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2505.00150"},"observation_digest":"sha256:bc515083ba6a03496d86c83a1f2567d732b8a369d8b7fba6f0037c55c3b5edc1","observation_id":"715f2511-14f1-45ad-91ea-94d41e0d9a33","resolution":{"observed_at":"2026-08-16T04:55:28.095027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04156","last_updated":"2023-02-08T16:04:08Z","snapshot_observed_at":"2026-08-17T21:49:34.182285Z","submitted_at":"2023-02-08T16:04:08Z","title":"Prompting for Multimodal Hateful Meme Classification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04156","snapshot_observed_at":"2026-08-16T04:55:28.101046Z","title":"Prompting for multimodal hateful meme classification","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00150","last_updated":"2025-04-30T19:48:12Z","snapshot_observed_at":"2026-08-17T21:50:16.587671Z","submitted_at":"2025-04-30T19:48:12Z","title":"Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T04:55:28.101046Z"},"links":{"cited_paper":"/paper/2302.04156","citing_paper":"/paper/2505.00150"},"observation_digest":"sha256:3d60e202a53cb33928713f53222e8367798410d16b2df91f8cae9ea13d99b5f6","observation_id":"ab681ece-2041-4fd9-ac45-237358c941fb","resolution":{"observed_at":"2026-08-16T04:55:28.101046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:55:29.118863Z","title":"Modularized networks for few-shot hateful meme detection","venue":null,"work_id":"9eba9066-2d80-43b5-b1e6-fd751b7259a8","year":2024},"citing_paper":{"arxiv_id":"2505.00150","last_updated":"2025-04-30T19:48:12Z","snapshot_observed_at":"2026-08-17T21:50:16.587671Z","submitted_at":"2025-04-30T19:48:12Z","title":"Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T04:55:28.107326Z"},"links":{"citing_paper":"/paper/2505.00150"},"observation_digest":"sha256:62c9b6839825ebca0ffb6c8a02f5d8bff380a58d3b461564cd0af8c9da9be2ad","observation_id":"4dae2445-6fe6-4f36-ac7e-5c76545edf3d","resolution":{"observed_at":"2026-08-16T04:55:29.124204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-16T01:18:27.067382Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-16T04:55:28.112729Z","title":"Microsoft coco captions: Data collection and evaluation server","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.00150","last_updated":"2025-04-30T19:48:12Z","snapshot_observed_at":"2026-08-17T21:50:16.587671Z","submitted_at":"2025-04-30T19:48:12Z","title":"Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T04:55:28.112729Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2505.00150"},"observation_digest":"sha256:8c6aa721f6b7b9589fada6e0e1fdb7be4a4d54bd5ec5c69c6c20eec29df71004","observation_id":"8cc59cd8-b6d4-4ccb-979a-ad3a279ab324","resolution":{"observed_at":"2026-08-16T04:55:28.112729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-16T04:55:28.118746Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.00150","last_updated":"2025-04-30T19:48:12Z","snapshot_observed_at":"2026-08-17T21:50:16.587671Z","submitted_at":"2025-04-30T19:48:12Z","title":"Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T04:55:28.118746Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2505.00150"},"observation_digest":"sha256:ceb7691c88a53a118aaf4613c9f2592a57a1cdc3f9e640690f7331f138931746","observation_id":"17e15a67-b841-44b9-978a-f1a048b1bb29","resolution":{"observed_at":"2026-08-16T04:55:28.118746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:55:28.124735Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.00150","last_updated":"2025-04-30T19:48:12Z","snapshot_observed_at":"2026-08-17T21:50:16.587671Z","submitted_at":"2025-04-30T19:48:12Z","title":"Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T04:55:28.124735Z"},"links":{"citing_paper":"/paper/2505.00150"},"observation_digest":"sha256:7a910f49b0533e8b095e166633ae0fa689fd4be72fc425050dd4241afb291779","observation_id":"58749952-d8c6-4df9-8cc9-7cb8672a5cda","resolution":{"observed_at":"2026-08-16T04:55:28.124735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:55:29.087964Z","title":"Recent advances in online hate speech moderation: Multimodality and the role of large models","venue":null,"work_id":"cdecf758-a08d-45cc-be2f-ceb971a0ce38","year":2024},"citing_paper":{"arxiv_id":"2505.00150","last_updated":"2025-04-30T19:48:12Z","snapshot_observed_at":"2026-08-17T21:50:16.587671Z","submitted_at":"2025-04-30T19:48:12Z","title":"Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T04:55:28.129926Z"},"links":{"citing_paper":"/paper/2505.00150"},"observation_digest":"sha256:6f9cc0420a3bad645751c6a302f91b52b2b1a203088908251f69e232664fb6e0","observation_id":"d29ebf04-445a-4509-8709-b2dfbb4d99bb","resolution":{"observed_at":"2026-08-16T04:55:29.093645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:55:28.134604Z","title":"Openclip, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00150","last_updated":"2025-04-30T19:48:12Z","snapshot_observed_at":"2026-08-17T21:50:16.587671Z","submitted_at":"2025-04-30T19:48:12Z","title":"Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T04:55:28.134604Z"},"links":{"citing_paper":"/paper/2505.00150"},"observation_digest":"sha256:6b66f5f2cb73d155f9079aaa6dde4095a34dc89eb1a5fe59794c89ff8fa2871b","observation_id":"b0a87666-f99c-40cb-ab81-2bd4a9bac7fc","resolution":{"observed_at":"2026-08-16T04:55:28.134604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:55:29.059417Z","title":"Capalign: Improving cross modal alignment via informative captioning for harmful meme detection","venue":null,"work_id":"6d0cf7ff-f0af-49bc-9663-009c2eac2ebd","year":2024},"citing_paper":{"arxiv_id":"2505.00150","last_updated":"2025-04-30T19:48:12Z","snapshot_observed_at":"2026-08-17T21:50:16.587671Z","submitted_at":"2025-04-30T19:48:12Z","title":"Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T04:55:28.139044Z"},"links":{"citing_paper":"/paper/2505.00150"},"observation_digest":"sha256:4927ad1aed5de80366a815f9092ccdf74f0d14cc701d8b3c06236e52393333e7","observation_id":"c5d1c160-87dd-4d46-b1b1-721aacc15379","resolution":{"observed_at":"2026-08-16T04:55:29.064962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.02950","last_updated":"2020-11-12T03:08:28Z","snapshot_observed_at":"2026-08-11T01:44:30.029524Z","submitted_at":"2019-09-06T14:59:18Z","title":"Supervised Multimodal Bitransformers for Classifying Images and Text","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.02950","snapshot_observed_at":"2026-08-16T04:55:28.143837Z","title":"Supervised multimodal bitransformers for classifying images and text","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2505.00150","last_updated":"2025-04-30T19:48:12Z","snapshot_observed_at":"2026-08-17T21:50:16.587671Z","submitted_at":"2025-04-30T19:48:12Z","title":"Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T04:55:28.143837Z"},"links":{"cited_paper":"/paper/1909.02950","citing_paper":"/paper/2505.00150"},"observation_digest":"sha256:c1666b2bfc9b55ba238db7e7e71c919762a921f837311017dc1ccb126d2f471b","observation_id":"4784a6f9-9cad-4d84-9cc5-9d12b36057ed","resolution":{"observed_at":"2026-08-16T04:55:28.143837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:55:28.149189Z","title":"The hateful memes challenge: Detecting hate speech in multimodal memes","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.00150","last_updated":"2025-04-30T19:48:12Z","snapshot_observed_at":"2026-08-17T21:50:16.587671Z","submitted_at":"2025-04-30T19:48:12Z","title":"Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T04:55:28.149189Z"},"links":{"citing_paper":"/paper/2505.00150"},"observation_digest":"sha256:62f871fe0ac96e81bf4f3fe8d183a44ee4c1cd7cde3793387a4078f67c6a0e1f","observation_id":"90167aa6-9778-4423-819e-70e3b590095b","resolution":{"observed_at":"2026-08-16T04:55:28.149189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:55:29.030621Z","title":"The hateful memes challenge: Competition report","venue":null,"work_id":"825533fb-a627-43ed-b150-aab9108ca66b","year":2020},"citing_paper":{"arxiv_id":"2505.00150","last_updated":"2025-04-30T19:48:12Z","snapshot_observed_at":"2026-08-17T21:50:16.587671Z","submitted_at":"2025-04-30T19:48:12Z","title":"Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T04:55:28.153924Z"},"links":{"citing_paper":"/paper/2505.00150"},"observation_digest":"sha256:0d93166b3f1ef78305bee730a31bc32344fc790286e5f3ebf39d44eb154ac74d","observation_id":"a6da361d-0501-424c-a64e-90b3f5094bed","resolution":{"observed_at":"2026-08-16T04:55:29.036156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:55:29.012241Z","title":"Why is it hate speech? masked ratio- nale prediction for explainable hate speech detection","venue":null,"work_id":"49e01c22-3c89-4e46-b3de-a350fcbf8ab6","year":2022},"citing_paper":{"arxiv_id":"2505.00150","last_updated":"2025-04-30T19:48:12Z","snapshot_observed_at":"2026-08-17T21:50:16.587671Z","submitted_at":"2025-04-30T19:48:12Z","title":"Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T04:55:28.158511Z"},"links":{"citing_paper":"/paper/2505.00150"},"observation_digest":"sha256:e3c703c299f58c90335123d6eba6ee01f25943919cdc5d790d2fb3e9ebcf962c","observation_id":"83116132-e221-472d-99c3-835d39beed2a","resolution":{"observed_at":"2026-08-16T04:55:29.017987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:55:28.163110Z","title":"Segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00150","last_updated":"2025-04-30T19:48:12Z","snapshot_observed_at":"2026-08-17T21:50:16.587671Z","submitted_at":"2025-04-30T19:48:12Z","title":"Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T04:55:28.163110Z"},"links":{"citing_paper":"/paper/2505.00150"},"observation_digest":"sha256:5e1a89a6b13d9d0c221463bc732c42749b28a72009b9dc177aba2f2bec76038d","observation_id":"cfe61be9-246c-491d-ba36-3ce256c73838","resolution":{"observed_at":"2026-08-16T04:55:28.163110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00890","last_updated":"2023-06-01T16:50:07Z","snapshot_observed_at":"2026-08-09T05:23:28.778360Z","submitted_at":"2023-06-01T16:50:07Z","title":"LLaVA-Med: Training a Large Language-and-Vision Assistant for Biomedicine in One Day","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00890","snapshot_observed_at":"2026-08-16T04:55:28.168132Z","title":"Llava-med: Training a large language-and-vision assistant for biomedicine in one day","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00150","last_updated":"2025-04-30T19:48:12Z","snapshot_observed_at":"2026-08-17T21:50:16.587671Z","submitted_at":"2025-04-30T19:48:12Z","title":"Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T04:55:28.168132Z"},"links":{"cited_paper":"/paper/2306.00890","citing_paper":"/paper/2505.00150"},"observation_digest":"sha256:be4b985e1b79365d9459e1e6d613cb4eaea7926b05a1b23391e6547fafd876ed","observation_id":"c2ca12f7-87b6-4278-a7c3-a1028ff340de","resolution":{"observed_at":"2026-08-16T04:55:28.168132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03557","last_updated":"2019-08-09T17:57:13Z","snapshot_observed_at":"2026-08-07T01:39:40.489262Z","submitted_at":"2019-08-09T17:57:13Z","title":"VisualBERT: A Simple and Performant Baseline for Vision and Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03557","snapshot_observed_at":"2026-08-16T04:55:28.173187Z","title":"Visualbert: A simple and performant baseline for vision and language","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2505.00150","last_updated":"2025-04-30T19:48:12Z","snapshot_observed_at":"2026-08-17T21:50:16.587671Z","submitted_at":"2025-04-30T19:48:12Z","title":"Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T04:55:28.173187Z"},"links":{"cited_paper":"/paper/1908.03557","citing_paper":"/paper/2505.00150"},"observation_digest":"sha256:ca182082ed555e7b78797349ebca033a390c2c6339d7c34496f5c48168b2a56f","observation_id":"9a673173-6d41-46a3-92b8-bc454f84d70f","resolution":{"observed_at":"2026-08-16T04:55:28.173187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:55:28.979042Z","title":"Towards explainable harmful meme detection through multimodal debate between large language models","venue":null,"work_id":"19f9c93f-ae64-4d20-9393-0b4a70cd51d3","year":2024},"citing_paper":{"arxiv_id":"2505.00150","last_updated":"2025-04-30T19:48:12Z","snapshot_observed_at":"2026-08-17T21:50:16.587671Z","submitted_at":"2025-04-30T19:48:12Z","title":"Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T04:55:28.178135Z"},"links":{"citing_paper":"/paper/2505.00150"},"observation_digest":"sha256:6a86d02d13f623a3a2c400fdc4279d100cbfe37f1fdba81524c016eacebe3298","observation_id":"27cd51f3-2628-4dbd-b8cf-95fce6661f8f","resolution":{"observed_at":"2026-08-16T04:55:28.984925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.12871","last_updated":"2020-12-24T14:28:17Z","snapshot_observed_at":"2026-08-16T18:56:20.289840Z","submitted_at":"2020-12-23T18:37:11Z","title":"A Multimodal Framework for the Detection of Hateful Memes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.12871","snapshot_observed_at":"2026-08-16T04:55:28.182942Z","title":"A multimodal framework for the detection of hateful memes","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.00150","last_updated":"2025-04-30T19:48:12Z","snapshot_observed_at":"2026-08-17T21:50:16.587671Z","submitted_at":"2025-04-30T19:48:12Z","title":"Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T04:55:28.182942Z"},"links":{"cited_paper":"/paper/2012.12871","citing_paper":"/paper/2505.00150"},"observation_digest":"sha256:1bc315142f078a857594f8a10a557134724278c554e3d0e46a98688e6ca1b4ef","observation_id":"cb0c1590-2025-4a6d-91dd-c5cd6381f695","resolution":{"observed_at":"2026-08-16T04:55:28.182942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-16T04:55:28.188523Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00150","last_updated":"2025-04-30T19:48:12Z","snapshot_observed_at":"2026-08-17T21:50:16.587671Z","submitted_at":"2025-04-30T19:48:12Z","title":"Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T04:55:28.188523Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2505.00150"},"observation_digest":"sha256:7159fa7711229d95bc3f7b2e6269ef57d5f908c95f04a3420961cb57705430bf","observation_id":"12607ca3-8f04-45db-b528-c90674b99931","resolution":{"observed_at":"2026-08-16T04:55:28.188523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-16T04:55:28.193622Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00150","last_updated":"2025-04-30T19:48:12Z","snapshot_observed_at":"2026-08-17T21:50:16.587671Z","submitted_at":"2025-04-30T19:48:12Z","title":"Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T04:55:28.193622Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2505.00150"},"observation_digest":"sha256:590f9c4bcee0ffe9c29debd307a2612ab26ed9b12910a0d567c07f956f387642","observation_id":"92183d9d-f78a-4287-ae26-597e4739640c","resolution":{"observed_at":"2026-08-16T04:55:28.193622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.02265","snapshot_observed_at":"2026-08-16T04:55:28.198790Z","title":"Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2505.00150","last_updated":"2025-04-30T19:48:12Z","snapshot_observed_at":"2026-08-17T21:50:16.587671Z","submitted_at":"2025-04-30T19:48:12Z","title":"Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T04:55:28.198790Z"},"links":{"cited_paper":"/paper/1908.02265","citing_paper":"/paper/2505.00150"},"observation_digest":"sha256:66a5fd413df619d6778ce8af7a4cc01a81ed8bd9f05f75bd507cb062c6b5785c","observation_id":"16d433d1-594f-41b7-90f4-22b6da9fb43c","resolution":{"observed_at":"2026-08-16T04:55:28.198790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:55:28.961305Z","title":"Hatexplain: A benchmark dataset for explainable hate speech detection","venue":null,"work_id":"e627259a-5b51-454f-8991-7dd7640ddcf4","year":2021},"citing_paper":{"arxiv_id":"2505.00150","last_updated":"2025-04-30T19:48:12Z","snapshot_observed_at":"2026-08-17T21:50:16.587671Z","submitted_at":"2025-04-30T19:48:12Z","title":"Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T04:55:28.203784Z"},"links":{"citing_paper":"/paper/2505.00150"},"observation_digest":"sha256:d324dea8138c3d2a573393288f00fe8989f765ecf4d435c294a648bf0dc8995f","observation_id":"81d60a65-1c98-4d21-8c04-49174206c2b1","resolution":{"observed_at":"2026-08-16T04:55:28.966826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.08328","last_updated":"2021-07-06T07:25:14Z","snapshot_observed_at":"2026-08-09T21:22:17.646067Z","submitted_at":"2020-06-11T08:59:57Z","title":"ETHOS: an Online Hate Speech Detection Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.08328","snapshot_observed_at":"2026-08-16T04:55:28.208724Z","title":"Ethos: an online hate speech detection dataset","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.00150","last_updated":"2025-04-30T19:48:12Z","snapshot_observed_at":"2026-08-17T21:50:16.587671Z","submitted_at":"2025-04-30T19:48:12Z","title":"Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T04:55:28.208724Z"},"links":{"cited_paper":"/paper/2006.08328","citing_paper":"/paper/2505.00150"},"observation_digest":"sha256:92528c2017417299664a8d653c9ea0f58cd99e3a4cc8ff81a4a64f82395e350a","observation_id":"32d06113-ec91-4234-ae51-93dbe547cd37","resolution":{"observed_at":"2026-08-16T04:55:28.208724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.07788","last_updated":"2020-12-14T18:25:03Z","snapshot_observed_at":"2026-08-16T18:58:37.834885Z","submitted_at":"2020-12-14T18:25:03Z","title":"Vilio: State-of-the-art Visio-Linguistic Models applied to Hateful Memes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.07788","snapshot_observed_at":"2026-08-16T04:55:28.213637Z","title":"Vilio: State-of-the-art visio-linguistic models applied to hateful memes","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.00150","last_updated":"2025-04-30T19:48:12Z","snapshot_observed_at":"2026-08-17T21:50:16.587671Z","submitted_at":"2025-04-30T19:48:12Z","title":"Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T04:55:28.213637Z"},"links":{"cited_paper":"/paper/2012.07788","citing_paper":"/paper/2505.00150"},"observation_digest":"sha256:c6f376b8477146197607af72e0f7edc28fdb01d7e3663409cc09e5e7f616e01a","observation_id":"3e834cf9-0d87-4b47-b0bf-850ddca0a227","resolution":{"observed_at":"2026-08-16T04:55:28.213637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-16T04:55:28.218559Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00150","last_updated":"2025-04-30T19:48:12Z","snapshot_observed_at":"2026-08-17T21:50:16.587671Z","submitted_at":"2025-04-30T19:48:12Z","title":"Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T04:55:28.218559Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.00150"},"observation_digest":"sha256:470e5111662b4364be8e29580abe5939c0e32b18f98eec3a54946d1ee68535e7","observation_id":"ec4bab69-10c7-4529-92a0-14085d108fb3","resolution":{"observed_at":"2026-08-16T04:55:28.218559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:55:28.223211Z","title":"Unsafe diffusion: On the generation of unsafe images and hateful memes from text-to-image models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00150","last_updated":"2025-04-30T19:48:12Z","snapshot_observed_at":"2026-08-17T21:50:16.587671Z","submitted_at":"2025-04-30T19:48:12Z","title":"Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T04:55:28.223211Z"},"links":{"citing_paper":"/paper/2505.00150"},"observation_digest":"sha256:c576fde67d1c76d823c6bc49ab5bb7926ec3f3db5982be6e76026242432943ce","observation_id":"0f8bd0e9-2177-4d03-b8dd-4e67ba36e8e1","resolution":{"observed_at":"2026-08-16T04:55:28.223211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:55:28.228722Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00150","last_updated":"2025-04-30T19:48:12Z","snapshot_observed_at":"2026-08-17T21:50:16.587671Z","submitted_at":"2025-04-30T19:48:12Z","title":"Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T04:55:28.228722Z"},"links":{"citing_paper":"/paper/2505.00150"},"observation_digest":"sha256:ca13dfc912dd608933d8eb268f31232b572a139d82c7d33684d023f5a391f8a3","observation_id":"1da24017-0a3d-41c0-b2ae-fa22a565caab","resolution":{"observed_at":"2026-08-16T04:55:28.228722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.01497","last_updated":"2016-01-06T06:30:17Z","snapshot_observed_at":"2026-08-14T22:45:50.420062Z","submitted_at":"2015-06-04T07:58:34Z","title":"Faster R-CNN: Towards Real-Time Object Detection with Region Proposal Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.01497","snapshot_observed_at":"2026-08-16T04:55:28.233478Z","title":"Faster r-cnn: Towards real-time object detection with region proposal networks","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.00150","last_updated":"2025-04-30T19:48:12Z","snapshot_observed_at":"2026-08-17T21:50:16.587671Z","submitted_at":"2025-04-30T19:48:12Z","title":"Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T04:55:28.233478Z"},"links":{"cited_paper":"/paper/1506.01497","citing_paper":"/paper/2505.00150"},"observation_digest":"sha256:ca1d16fdc51d03f75ec8e054834911002a4c1dcb18602fe8e48712df258e92f9","observation_id":"6d9b3b92-8ba6-4e34-8337-a62d3532c2dc","resolution":{"observed_at":"2026-08-16T04:55:28.233478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.13235","last_updated":"2020-12-24T13:01:44Z","snapshot_observed_at":"2026-08-16T18:56:10.703674Z","submitted_at":"2020-12-24T13:01:44Z","title":"Detecting Hateful Memes Using a Multimodal Deep Ensemble","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.13235","snapshot_observed_at":"2026-08-16T04:55:28.238525Z","title":"Detecting hateful memes using a multimodal deep ensemble","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.00150","last_updated":"2025-04-30T19:48:12Z","snapshot_observed_at":"2026-08-17T21:50:16.587671Z","submitted_at":"2025-04-30T19:48:12Z","title":"Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T04:55:28.238525Z"},"links":{"cited_paper":"/paper/2012.13235","citing_paper":"/paper/2505.00150"},"observation_digest":"sha256:bbe029074344d7d402f15543e5fb70e37d6eb588fcb56b25d1181a5a2a6b1b12","observation_id":"c781a117-7ef3-44fe-929b-d80fef9691a6","resolution":{"observed_at":"2026-08-16T04:55:28.238525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:55:28.921765Z","title":"Detecting formal thought disorder by deep contextualized word representations","venue":null,"work_id":"4be8ce27-d7ee-4782-bcb7-815c5e2e42be","year":2021},"citing_paper":{"arxiv_id":"2505.00150","last_updated":"2025-04-30T19:48:12Z","snapshot_observed_at":"2026-08-17T21:50:16.587671Z","submitted_at":"2025-04-30T19:48:12Z","title":"Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T04:55:28.243316Z"},"links":{"citing_paper":"/paper/2505.00150"},"observation_digest":"sha256:9250ca788910ec0e4d2db698fde2e61194eb94ca70c69673ea6b67b2dcb8e291","observation_id":"9eda2e25-6c3e-42d7-8b47-906f7f2afa7b","resolution":{"observed_at":"2026-08-16T04:55:28.927220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:55:28.248211Z","title":"Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image captioning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.00150","last_updated":"2025-04-30T19:48:12Z","snapshot_observed_at":"2026-08-17T21:50:16.587671Z","submitted_at":"2025-04-30T19:48:12Z","title":"Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T04:55:28.248211Z"},"links":{"citing_paper":"/paper/2505.00150"},"observation_digest":"sha256:f658becfd4a8b8e31704cd18fc70529ccd0aecab1134b306422f6c9b1de283dd","observation_id":"ecba3b8f-09f6-407b-979a-efc115661f23","resolution":{"observed_at":"2026-08-16T04:55:28.248211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.13138","last_updated":"2022-12-26T14:28:24Z","snapshot_observed_at":"2026-08-16T16:05:58.712099Z","submitted_at":"2022-12-26T14:28:24Z","title":"Large Language Models Encode Clinical Knowledge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.13138","snapshot_observed_at":"2026-08-16T04:55:28.252964Z","title":"Large language models encode clinical knowledge","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.00150","last_updated":"2025-04-30T19:48:12Z","snapshot_observed_at":"2026-08-17T21:50:16.587671Z","submitted_at":"2025-04-30T19:48:12Z","title":"Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T04:55:28.252964Z"},"links":{"cited_paper":"/paper/2212.13138","citing_paper":"/paper/2505.00150"},"observation_digest":"sha256:b5ca17465a5dcd56778e825c721b074f637cbe760002d613dd0b5740ac99c366","observation_id":"709d1768-4ad3-4869-8d48-0abb639ea700","resolution":{"observed_at":"2026-08-16T04:55:28.252964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:55:28.891286Z","title":"Resolution-robust large mask inpainting with fourier convolutions","venue":null,"work_id":"71fa5033-7c1b-4d65-b29c-6891fc82bb43","year":2022},"citing_paper":{"arxiv_id":"2505.00150","last_updated":"2025-04-30T19:48:12Z","snapshot_observed_at":"2026-08-17T21:50:16.587671Z","submitted_at":"2025-04-30T19:48:12Z","title":"Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T04:55:28.257972Z"},"links":{"citing_paper":"/paper/2505.00150"},"observation_digest":"sha256:4751ad8ed2ffac486777cdb457a8c73860ec1473ad1210f62d8fc91f8454b67b","observation_id":"7e31eb3b-a8a7-4db6-b683-1e64fc33f7f8","resolution":{"observed_at":"2026-08-16T04:55:28.896919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-16T04:55:28.262753Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00150","last_updated":"2025-04-30T19:48:12Z","snapshot_observed_at":"2026-08-17T21:50:16.587671Z","submitted_at":"2025-04-30T19:48:12Z","title":"Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T04:55:28.262753Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.00150"},"observation_digest":"sha256:f0428e765d56ddaf0fbdc0eb2d3b04af96193f0aaae281fee793bc8ca9ed4861","observation_id":"e860ffdb-c39d-4dfa-878e-80d67f035e85","resolution":{"observed_at":"2026-08-16T04:55:28.262753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-16T04:55:28.268336Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00150","last_updated":"2025-04-30T19:48:12Z","snapshot_observed_at":"2026-08-17T21:50:16.587671Z","submitted_at":"2025-04-30T19:48:12Z","title":"Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T04:55:28.268336Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.00150"},"observation_digest":"sha256:e9db60abf5456ecbf246c293a882201353ffe1a19285685572c6054460beddde","observation_id":"fe78932e-7f8f-4f0b-849d-807cb4ac6294","resolution":{"observed_at":"2026-08-16T04:55:28.268336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:55:28.872463Z","title":"On large visual language models for medical imaging analysis: An empirical study","venue":null,"work_id":"221e8b0a-15f8-415f-abaf-182bbf22a256","year":2024},"citing_paper":{"arxiv_id":"2505.00150","last_updated":"2025-04-30T19:48:12Z","snapshot_observed_at":"2026-08-17T21:50:16.587671Z","submitted_at":"2025-04-30T19:48:12Z","title":"Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T04:55:28.273511Z"},"links":{"citing_paper":"/paper/2505.00150"},"observation_digest":"sha256:5257aa1f880a3dae4d4ccd9f09687a9ee224971060e11aaa1b45754c0f2ebfbb","observation_id":"2b00b850-8e44-4985-8f20-bf7c41cd78e9","resolution":{"observed_at":"2026-08-16T04:55:28.877975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.12975","last_updated":"2020-12-23T21:09:52Z","snapshot_observed_at":"2026-08-17T14:14:36.193514Z","submitted_at":"2020-12-23T21:09:52Z","title":"Detecting Hate Speech in Memes Using Multimodal Deep Learning Approaches: Prize-winning solution to Hateful Memes Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.12975","snapshot_observed_at":"2026-08-16T04:55:28.278432Z","title":"Detecting hate speech in memes using multimodal deep learning approaches: Prize-winning solution to hateful memes challenge","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.00150","last_updated":"2025-04-30T19:48:12Z","snapshot_observed_at":"2026-08-17T21:50:16.587671Z","submitted_at":"2025-04-30T19:48:12Z","title":"Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T04:55:28.278432Z"},"links":{"cited_paper":"/paper/2012.12975","citing_paper":"/paper/2505.00150"},"observation_digest":"sha256:ebfb17b8ea4afe4b1b3b4e2d228ebdd72dcf7a64de364a363f4115db18025428","observation_id":"68a69b57-5211-4cec-aab3-d4b763283f99","resolution":{"observed_at":"2026-08-16T04:55:28.278432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:55:28.853967Z","title":"Memecraft: Contextual and stance-driven multimodal meme generation","venue":null,"work_id":"21539c92-1020-4021-9c36-a6ce81263de8","year":2024},"citing_paper":{"arxiv_id":"2505.00150","last_updated":"2025-04-30T19:48:12Z","snapshot_observed_at":"2026-08-17T21:50:16.587671Z","submitted_at":"2025-04-30T19:48:12Z","title":"Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T04:55:28.283296Z"},"links":{"citing_paper":"/paper/2505.00150"},"observation_digest":"sha256:dadedc76855433bf8dbdb913f0bdc0eac0c5f0b9a1446f8b3289efd1e4982714","observation_id":"176e6f5b-20fb-42bf-9ac9-65154d5a5c81","resolution":{"observed_at":"2026-08-16T04:55:28.859820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-17T09:50:53.260956Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-08-16T04:55:28.288109Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00150","last_updated":"2025-04-30T19:48:12Z","snapshot_observed_at":"2026-08-17T21:50:16.587671Z","submitted_at":"2025-04-30T19:48:12Z","title":"Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T04:55:28.288109Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2505.00150"},"observation_digest":"sha256:2d9593df777efe571a5ad28b711e37c2c71bad8c2029c4badc999bf7ca466751","observation_id":"d48cd019-2e12-462d-9843-8ecb8b589f24","resolution":{"observed_at":"2026-08-16T04:55:28.288109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:55:28.293095Z","title":"Aggregated residual transformations for deep neural networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.00150","last_updated":"2025-04-30T19:48:12Z","snapshot_observed_at":"2026-08-17T21:50:16.587671Z","submitted_at":"2025-04-30T19:48:12Z","title":"Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T04:55:28.293095Z"},"links":{"citing_paper":"/paper/2505.00150"},"observation_digest":"sha256:3bb3f48924e480a636c76a961bfc152231a793bf8f1a173a28223ce23024a451","observation_id":"2c9ce84d-1427-4cd6-bc88-1e6c9aee62de","resolution":{"observed_at":"2026-08-16T04:55:28.293095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:55:28.825421Z","title":"Coded hate speech detection via contextual information","venue":null,"work_id":"fa3c01cf-254b-4a0c-a154-6c93031d1ccd","year":2022},"citing_paper":{"arxiv_id":"2505.00150","last_updated":"2025-04-30T19:48:12Z","snapshot_observed_at":"2026-08-17T21:50:16.587671Z","submitted_at":"2025-04-30T19:48:12Z","title":"Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T04:55:28.297774Z"},"links":{"citing_paper":"/paper/2505.00150"},"observation_digest":"sha256:eea4cbebeb94a5a1a65ab85155530e29a307ba0d9702199cb08ce2a0894e4f3f","observation_id":"7c3ae4b9-e547-49c0-8cfa-c47ea4533354","resolution":{"observed_at":"2026-08-16T04:55:28.830858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:55:28.807699Z","title":"An empirical study of gpt-3 for few-shot knowledge-based vqa","venue":null,"work_id":"c0e0f2ab-2f23-4cda-9029-60b984274ae6","year":2022},"citing_paper":{"arxiv_id":"2505.00150","last_updated":"2025-04-30T19:48:12Z","snapshot_observed_at":"2026-08-17T21:50:16.587671Z","submitted_at":"2025-04-30T19:48:12Z","title":"Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T04:55:28.302275Z"},"links":{"citing_paper":"/paper/2505.00150"},"observation_digest":"sha256:e3446b946680b107d3891a71e78001f49ab78b0c1df368d5c8c73cefaebf3a5c","observation_id":"5bb76d33-83f3-434a-a6c0-ce0a5f822d11","resolution":{"observed_at":"2026-08-16T04:55:28.813384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06790","last_updated":"2023-04-13T19:23:52Z","snapshot_observed_at":"2026-08-16T15:40:35.889657Z","submitted_at":"2023-04-13T19:23:52Z","title":"Inpaint Anything: Segment Anything Meets Image Inpainting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06790","snapshot_observed_at":"2026-08-16T04:55:28.307144Z","title":"Inpaint anything: Segment anything meets image inpainting","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00150","last_updated":"2025-04-30T19:48:12Z","snapshot_observed_at":"2026-08-17T21:50:16.587671Z","submitted_at":"2025-04-30T19:48:12Z","title":"Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T04:55:28.307144Z"},"links":{"cited_paper":"/paper/2304.06790","citing_paper":"/paper/2505.00150"},"observation_digest":"sha256:b45fdbcb072c8f89e4492c7c96182125f5d4bd72f87acc2c3188c3dbae303dc0","observation_id":"041eb16d-2f38-4db5-a17d-8deb554b4ecc","resolution":{"observed_at":"2026-08-16T04:55:28.307144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16199","last_updated":"2024-09-18T23:54:36Z","snapshot_observed_at":"2026-08-13T10:46:50.834601Z","submitted_at":"2023-03-28T17:59:12Z","title":"LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16199","snapshot_observed_at":"2026-08-16T04:55:28.312338Z","title":"Llama-adapter: Efficient fine-tuning of language models with zero-init attention","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00150","last_updated":"2025-04-30T19:48:12Z","snapshot_observed_at":"2026-08-17T21:50:16.587671Z","submitted_at":"2025-04-30T19:48:12Z","title":"Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T04:55:28.312338Z"},"links":{"cited_paper":"/paper/2303.16199","citing_paper":"/paper/2505.00150"},"observation_digest":"sha256:e1b06107b577ba27be5de6ae16a2a3e8adc9529165af7800420e2d90e1bed463","observation_id":"fa5ea7f7-4550-4bbf-a441-ac8e85e1a750","resolution":{"observed_at":"2026-08-16T04:55:28.312338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-16T04:55:28.317391Z","title":"Opt: Open pre-trained transformer language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.00150","last_updated":"2025-04-30T19:48:12Z","snapshot_observed_at":"2026-08-17T21:50:16.587671Z","submitted_at":"2025-04-30T19:48:12Z","title":"Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T04:55:28.317391Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2505.00150"},"observation_digest":"sha256:bf377605f5ce4fbf8f61611de80f8a1222d4d529327035adbb668462ad379ed9","observation_id":"42b50c13-34e7-4099-9e99-690d94fb0514","resolution":{"observed_at":"2026-08-16T04:55:28.317391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.08290","last_updated":"2020-12-15T13:57:21Z","snapshot_observed_at":"2026-08-16T18:58:23.057387Z","submitted_at":"2020-12-15T13:57:21Z","title":"Enhance Multimodal Transformer With External Label And In-Domain Pretrain: Hateful Meme Challenge Winning Solution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.08290","snapshot_observed_at":"2026-08-16T04:55:28.322480Z","title":"Enhance multimodal transformer with external label and in-domain pretrain: Hateful meme challenge winning solution","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.00150","last_updated":"2025-04-30T19:48:12Z","snapshot_observed_at":"2026-08-17T21:50:16.587671Z","submitted_at":"2025-04-30T19:48:12Z","title":"Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T04:55:28.322480Z"},"links":{"cited_paper":"/paper/2012.08290","citing_paper":"/paper/2505.00150"},"observation_digest":"sha256:fb3dfc4525ccc6c14be791daa57a8a8ecc80e13e307f30ee6c83ce193088e311","observation_id":"2e316939-a3d1-44fd-ab84-4eeaa6169eb7","resolution":{"observed_at":"2026-08-16T04:55:28.322480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:55:28.787922Z","title":"C.2 Multimodal: unimodal pretraining Multimodal models from unimodal pretraining typically combine the output or the features of vision and linguistic models","venue":null,"work_id":"61b9d737-5ab2-40e5-9332-4b19072e2f96","year":null},"citing_paper":{"arxiv_id":"2505.00150","last_updated":"2025-04-30T19:48:12Z","snapshot_observed_at":"2026-08-17T21:50:16.587671Z","submitted_at":"2025-04-30T19:48:12Z","title":"Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models","version":1},"reference_index":768,"source":"pdf_text","source_observed_at":"2026-08-16T04:55:28.327964Z"},"links":{"citing_paper":"/paper/2505.00150"},"observation_digest":"sha256:0832ce6983a2910a50b2bf8c0eef668e52654e660f88271103ce3986650a25a9","observation_id":"d1570484-a50e-4715-a304-3ca31926a19e","resolution":{"observed_at":"2026-08-16T04:55:28.795461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.00150","last_updated":"2025-04-30T19:48:12Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T21:50:16.587671Z","submitted_at":"2025-04-30T19:48:12Z","title":"Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":0,"verified_fuzzy":15},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 0 inbound Pith citation observations for arXiv:2505.00150."}