{"as_of":"2026-08-19T17:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2f6564662053bb933583844d49adeeb6ec0bda07c211cadaef25aa25ee979468","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T15:33:30.363072Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.14137/citation-record","integrity":"/paper/2411.14137/integrity","json":"/paper/2411.14137/citation-record.json","paper":"/paper/2411.14137"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.05315","last_updated":"2024-12-01T06:49:31Z","snapshot_observed_at":"2026-08-18T00:25:05.176432Z","submitted_at":"2024-12-01T06:49:31Z","title":"Text Is Not All You Need: Multimodal Prompting Helps LLMs Understand Humor","version":1},"cited_work":{"arxiv_id":"2412.05315","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.05315","snapshot_observed_at":"2026-08-12T15:33:30.883685Z","title":"Text Is Not All You Need: Multimodal Prompting Helps LLMs Understand Humor","venue":"cs.CL","work_id":"acb3c97a-3d41-457a-ad0e-74854b94f257","year":2024},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.491407Z"},"links":{"cited_paper":"/paper/2412.05315","citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:d80180137f224598d8f692df29f3fbaf1b520d9ae78cc4b134df5a77f67d44ef","observation_id":"0725f70a-b521-4fa7-a790-7e563d81a0a5","resolution":{"observed_at":"2026-08-12T15:33:30.939571Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:33.290829Z","title":"Improv- ing image generation with better captions","venue":null,"work_id":"1e25208b-9b33-4c26-9fc9-216b35693231","year":null},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.529684Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:89dabe9e8799a0771c909b09ce600ea49f00d57b3d6d9f6b2d501523fa7b5937","observation_id":"6509cdc8-b1db-471e-ae37-2a63dbf15b71","resolution":{"observed_at":"2026-08-12T15:33:33.367661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:33.142393Z","title":"Explicit modelling of theory of mind for belief prediction in nonverbal social interactions","venue":null,"work_id":"ecdca5e8-a1a2-48bc-b964-7b3f8aae9b90","year":2024},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.580876Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:4a0ad144e0d75f084840c41f26879e22db5c039c66e5f3e3ebf480ad92b66df8","observation_id":"4fcbfafb-4a7c-468f-9b6f-ee5a58a999be","resolution":{"observed_at":"2026-08-12T15:33:33.213492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:33.130037Z","title":"FLUTE: Figurative language understand- ing through textual explanations","venue":null,"work_id":"c8a5ea60-ecc0-466b-b3f6-785fd2204fab","year":2022},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.596552Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:9f1cc1e03f9229f65fa00fa14c111565bb85849837fd5c9551cb5c87d1dd20ea","observation_id":"e703c411-b4c2-44c3-b556-8df40b437cde","resolution":{"observed_at":"2026-08-12T15:33:33.134512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:28.648994Z","title":"Through the theory of mind’s eye: Reading minds with multimodal video large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.648994Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:7ea1a319c1fc330b1d85485f0e0087076383d80e7348a53397d90cb7422cd9eb","observation_id":"3bed0c64-0023-4bc1-9a7a-5629e3bb8d32","resolution":{"observed_at":"2026-08-12T15:33:28.648994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-08-17T14:16:52.244007Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-12T15:33:28.683777Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.683777Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:5459d7d43ae15983323586e387d2e2d91726564f823200953e58df6b8065367d","observation_id":"076bcb41-30e8-4181-8095-28dfe22918c9","resolution":{"observed_at":"2026-08-12T15:33:28.683777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:33.112000Z","title":"The limitations of large language models for understanding human language and cognition","venue":null,"work_id":"14d590e1-32f2-4799-8ebd-364f89fc6f35","year":2024},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.731726Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:b9719e2a5b3d0f80e20e0bef74d695585d4dd68a5f6940bb5edf7fc1d10b41c9","observation_id":"ae2b0df4-b8e5-4646-a0bc-6b4ad9ea0a27","resolution":{"observed_at":"2026-08-12T15:33:33.115698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:33.101188Z","title":"Docmsu: A comprehensive benchmark for document- level multimodal sarcasm understanding","venue":null,"work_id":"1982a107-9451-4192-9978-567fc08cb3d8","year":2024},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.784948Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:2f455871e611b7d131e7b37d20cd61d53db956b4e8aa78c0c92c5a35099b5bd8","observation_id":"50da5126-56f0-4f38-a2bd-ac5fe18a9868","resolution":{"observed_at":"2026-08-12T15:33:33.104945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10665","last_updated":"2022-06-21T18:29:17Z","snapshot_observed_at":"2026-08-19T12:51:54.069730Z","submitted_at":"2022-06-21T18:29:17Z","title":"BOSS: A Benchmark for Human Belief Prediction in Object-context Scenarios","version":1},"cited_work":{"arxiv_id":"2206.10665","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.10665","snapshot_observed_at":"2026-08-12T15:33:30.723876Z","title":"BOSS: A Benchmark for Human Belief Prediction in Object-context Scenarios","venue":"cs.CV","work_id":"634eafea-3da8-4b0b-96ef-6d258d9f6b65","year":2022},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.837774Z"},"links":{"cited_paper":"/paper/2206.10665","citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:9f9f3e3f753b656e3480c00e169bda655d0768a5497f36d28f4ff6bcf1f95abd","observation_id":"888c766c-645b-4fa7-b65a-d6f0dca1cf52","resolution":{"observed_at":"2026-08-12T15:33:30.742152Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:33.088653Z","title":"Multi-modal hallucination control by visual information grounding","venue":null,"work_id":"311782fe-90ee-4bfb-ad1d-3a7cea4c5ff7","year":2024},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.863690Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:b3c685976c3ef68ec15935889e6f59ada2eb2086a3bbf2ce969af685d6392c8b","observation_id":"6a8363b7-6d8e-4f6e-a481-c3aa7310b7f9","resolution":{"observed_at":"2026-08-12T15:33:33.092537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:33.076942Z","title":null,"venue":null,"work_id":"f79a4354-852a-4905-a85d-a0d07135e868","year":2023},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.894133Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:c94df005916ad437029913f15189bc0d6cfc50d92c9f2b2876a2fd52c4515d67","observation_id":"474b4c43-8531-4f92-b1f5-495d965d8294","resolution":{"observed_at":"2026-08-12T15:33:33.080854Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-12T15:33:28.903052Z","title":"Gemini 1.5: Unlocking multimodal under- standing across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.903052Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:954521ebc0005dc47b0d1a25f73bfc5bf299819c2597ae8b55d109357d6d680a","observation_id":"d565480c-4a1b-4889-b6c8-9989c5576a98","resolution":{"observed_at":"2026-08-12T15:33:28.903052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:33.028928Z","title":"UR-FUNNY: A multimodal language dataset for understanding humor","venue":null,"work_id":"bd8cd053-6c4e-4528-a19e-0b11ef602aea","year":2019},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:28.941400Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:a400e464dbb5ed96f3b639f9bf26b2f950cff11c1a3a680fc80d1f5d3c3c54a3","observation_id":"b6b50aad-7f55-4664-8295-391da868bac1","resolution":{"observed_at":"2026-08-12T15:33:33.069211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:32.738860Z","title":"understanding","venue":null,"work_id":"6407294a-440a-4c4a-8b78-d53739323743","year":2023},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.002772Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:5c65550d7b25f42ad110968d49f5601809be4ffcc4ae108afbd1979c55f15921","observation_id":"a2125613-fafd-4ba1-b62f-c8a089fbd807","resolution":{"observed_at":"2026-08-12T15:33:32.872512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13703","last_updated":"2023-05-23T05:41:18Z","snapshot_observed_at":"2026-08-16T15:30:48.154782Z","submitted_at":"2023-05-23T05:41:18Z","title":"MemeCap: A Dataset for Captioning and Interpreting Memes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13703","snapshot_observed_at":"2026-08-12T15:33:29.062742Z","title":"Memecap: A dataset for captioning and interpreting memes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.062742Z"},"links":{"cited_paper":"/paper/2305.13703","citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:66457a153e49d0ea079cffbfb8634865bb89872edf29ef237b8446a0330147c5","observation_id":"896b2410-579c-4b57-acec-8ded9fbcba2b","resolution":{"observed_at":"2026-08-12T15:33:29.062742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09899","last_updated":"2024-01-18T11:24:30Z","snapshot_observed_at":"2026-08-16T14:26:30.185730Z","submitted_at":"2024-01-18T11:24:30Z","title":"Meme-ingful Analysis: Enhanced Understanding of Cyberbullying in Memes Through Multimodal Explanations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09899","snapshot_observed_at":"2026-08-12T15:33:29.128578Z","title":"Meme-ingful analysis: Enhanced understanding of cyberbullying in memes through multimodal explanations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.128578Z"},"links":{"cited_paper":"/paper/2401.09899","citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:bc92cad3d123a3f17aeee823eaf22d6e76f28d539f93ed8561cbbdc35c6d1f33","observation_id":"02042789-40c8-494c-84e2-5f290b674e13","resolution":{"observed_at":"2026-08-12T15:33:29.128578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:32.658176Z","title":"MMToM-QA: Mul- timodal theory of mind question answering","venue":null,"work_id":"a179c593-7718-441e-aea8-ec6e5581ae94","year":2024},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.161723Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:ed625fa1e50586d2fc5b03f1454fe149b0475f9b62fc2bfd5b77a8475aefd3fa","observation_id":"ee465fe2-afb8-4954-bf46-a44d9d94c6a4","resolution":{"observed_at":"2026-08-12T15:33:32.663428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:32.643468Z","title":"Yolov11: An overview of the key architectural enhancements, 2024","venue":null,"work_id":"a77d0e28-cdc5-4bbd-a798-9900012e9489","year":2024},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.174933Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:0a4b1754abf9ffda8d8bcf3a9e20ee9b84a346fc0624461967a50022b873cb0c","observation_id":"7d2953d2-7611-4b2f-a6d3-92410c0da2ce","resolution":{"observed_at":"2026-08-12T15:33:32.647468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:32.630690Z","title":"When did you become so smart, oh wise one?! sarcasm explanation in multi-modal multi-party dia- logues","venue":null,"work_id":"01dcb588-53e8-435b-ba3e-145ae79066cb","year":2022},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.183698Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:9554e1ceab6eca884022f8b11710ef9a7645166242c9f76d1b2bbd9022b896e0","observation_id":"f2e92296-a41c-4d75-aff4-f75c8418537a","resolution":{"observed_at":"2026-08-12T15:33:32.635641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:32.615161Z","title":"Explaining (sarcastic) utterances to enhance affect understanding in multimodal dialogues","venue":null,"work_id":"64d9c0dc-53eb-464e-a06c-86645d70c33a","year":2023},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.188496Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:788a238d4f6fa4285bf07741b46596a1d86c127797ba19460b4d4e02905f6406","observation_id":"5c2e77f2-115f-420c-b3ed-7cba9a6afc8f","resolution":{"observed_at":"2026-08-12T15:33:32.620029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:32.602116Z","title":"SBU figures it out: Models explain figurative language","venue":null,"work_id":"0db99172-4d04-4352-8c51-57d397087d5d","year":2022},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.236407Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:e87b97124206a65963cfef32e057de20b3860067f213ba373dd8f9eac132466c","observation_id":"edf4a422-c6cd-41d2-a83e-3a6376b6ca47","resolution":{"observed_at":"2026-08-12T15:33:32.606123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:32.587557Z","title":"What matters when building vision-language mod- els? Advances in Neural Information Processing Systems, 37: 87874–87907, 2025","venue":null,"work_id":"937b3000-c255-4e99-a0b5-0d6f52da188c","year":2025},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.296501Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:611ee1591ef817ef9f44cc228b8284f6fe8c2236b026bda3ff4860024917ae49","observation_id":"b50fce51-3132-453c-a6df-1805cb831506","resolution":{"observed_at":"2026-08-12T15:33:32.592531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-18T11:56:50.710310Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-12T15:33:29.352196Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.352196Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:7cb5428a537d5c0bd9187aa4b501e40b4ee33360b3d57a2305d9a4da03cd7454","observation_id":"bc88d951-6b2d-4ede-8489-658ff5da0aca","resolution":{"observed_at":"2026-08-12T15:33:29.352196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:32.573075Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models, 2024","venue":null,"work_id":"1848c114-5bfe-49b4-b172-9cb9a314453f","year":2024},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.380370Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:d67d26a7da4358e17d6143de58eaa7e4f53fe25444e82c7b00f975ae555b03eb","observation_id":"10067569-cc7f-454c-a399-5167e453cc4f","resolution":{"observed_at":"2026-08-12T15:33:32.578291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:32.364779Z","title":"Li, Sachin Goyal, Joao D","venue":null,"work_id":"94fdd25c-c0bd-49d0-8da8-6b6db8e5dd1b","year":2025},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.387804Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:2e404528faacaad9859ddaa3a504a789ef9663a74e70da3daa9a77cddc931dbd","observation_id":"3e0280d9-2206-46db-bbdf-f65036490f6b","resolution":{"observed_at":"2026-08-12T15:33:32.464510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:32.173104Z","title":"Lawrence Zitnick","venue":null,"work_id":"61effcd1-f0a5-40de-9aee-5b60bf74a9ef","year":2014},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.391473Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:a10ed9ae15aa9e2945d51ae6293635ee20f548a4ed63253883d766b8c69facea","observation_id":"372eb27f-ab0c-4fdd-9d65-451b9964e9c0","resolution":{"observed_at":"2026-08-12T15:33:32.247970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:32.160759Z","title":"I’d rather just go to bed","venue":null,"work_id":"6c397a28-5dab-4e52-b378-1e9dc872dfb1","year":2020},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.395979Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:f5490d7be1058b20f266834dd4c44e15ad640da1d02b86c4b79c2d49c3f2c7b3","observation_id":"62148796-817b-4784-8359-2d4067a3e572","resolution":{"observed_at":"2026-08-12T15:33:32.164843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-12T15:33:29.453481Z","title":"Ovis: Structural embed- ding alignment for multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.453481Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:0b1df8e6d9a8852d5c04622565a37cc8a3d769363d40fb4e5c589cf27ced48c4","observation_id":"4a30158a-bbd4-454f-a035-56074b10d43a","resolution":{"observed_at":"2026-08-12T15:33:29.453481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:32.146848Z","title":"Phi-3 technical report: A highly capable language model locally on your phone, 2024","venue":null,"work_id":"faee1521-3e5c-4ab5-8c9d-65e0f632debb","year":2024},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.516333Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:afef9d540ea624251ac6348f78deb49a2d5b2ad76c6b662074ba6606d5d70a9c","observation_id":"e4966893-9e12-4ab7-b0d4-2a9fdff21652","resolution":{"observed_at":"2026-08-12T15:33:32.151042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:32.134182Z","title":"What is the real intention behind this question? dataset collec- tion and intention classification","venue":null,"work_id":"1828c9bc-1ccc-4fc0-b48c-40426b9f62d9","year":2023},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.560220Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:b44f31c6fbc30b333785b3a9247f655fc8810daf39a770c97c481ddcaebb6ff0","observation_id":"374a0525-13a6-45ab-95cb-9deafafa9a8b","resolution":{"observed_at":"2026-08-12T15:33:32.138482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T15:33:29.629289Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.629289Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:e99043152ac67a0048dccfc01564cd059859af432c0a87f5acd455966f61003c","observation_id":"5cf83a1b-4209-40bf-8ef6-5ead41dd6743","resolution":{"observed_at":"2026-08-12T15:33:29.629289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:29.680192Z","title":"Sentiment-enhanced graph-based sarcasm explanation in dialogue","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.680192Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:768c4f6df74381fbba96b0505d441b2410e44a1299917a7c02ea35a40095be5b","observation_id":"8a9a8a9b-61e0-43c1-a99c-c31f6d4b938c","resolution":{"observed_at":"2026-08-12T15:33:29.680192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:32.123454Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":"f53a5b01-0cb4-47d1-86d0-06b984b16c8e","year":2002},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.722538Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:4aece067e5e0b8fddd8af5f6aa41152e43371b0a084524e78ee16397f1fea067","observation_id":"a71c14b5-927e-419c-b450-4b29876865ab","resolution":{"observed_at":"2026-08-12T15:33:32.127003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:32.111739Z","title":"Does the chimpanzee have a theory of mind? Behavioral and brain sciences, 1(4): 515–526, 1978","venue":null,"work_id":"ff2023d2-61ef-4fbc-b914-9ca01c49236a","year":1978},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.739926Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:66b77872b7e796cc8961beb7729a31283492226f1687c00ee7e59749b0c82740","observation_id":"98702e3a-598d-45b7-83dc-41c4cfa640c1","resolution":{"observed_at":"2026-08-12T15:33:32.116069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:32.097378Z","title":"Movie description","venue":null,"work_id":"03038900-ed6a-4359-8b63-6a36490fb27c","year":2017},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.745047Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:adf3879aa4af1bf7ce3f861be2029689ffb5500434fa5498e5a542876f41e09e","observation_id":"aebe7f45-fbbd-4a84-bccd-8936be49e26b","resolution":{"observed_at":"2026-08-12T15:33:32.102046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:32.085829Z","title":"Minding language models’ (lack of) theory of mind: A plug-and-play multi-character belief tracker","venue":null,"work_id":"bb7f6a21-a4a1-4310-b9c9-fa4e7031498e","year":2023},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.748911Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:a031543e9d7c0a49bad33ad318e85c07a737b8b997b600b26a3e69879d812527","observation_id":"abc18ea5-439b-42e7-8be0-9fa1e59807ef","resolution":{"observed_at":"2026-08-12T15:33:32.089639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.864230Z","title":"Muma-tom: Multi-modal multi-agent theory of mind, 2024","venue":null,"work_id":"5be8c5f8-98ee-495c-ae41-1fa020a04dd6","year":2024},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.808735Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:121991aa4e5e9e21e1e472bdc4d45f900f32ece2d0971412d0bfe357695cd2c1","observation_id":"6e1dcf27-8b75-47fc-bdcc-2e6d327657cd","resolution":{"observed_at":"2026-08-12T15:33:31.969358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.850754Z","title":"PUB: A pragmatics understanding benchmark for assessing LLMs’ pragmatics capabilities","venue":null,"work_id":"13301b25-dd28-442e-b277-b43248eb8c0d","year":2024},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.880056Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:bfc910c807b92ce594efd06cdda8596b8babfa13b3ff233799df38543d0de977","observation_id":"c7160918-d9e7-42f7-b088-b65fb9f8f0fd","resolution":{"observed_at":"2026-08-12T15:33:31.855245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.839302Z","title":"DeepMet: A reading com- prehension paradigm for token-level metaphor detection","venue":null,"work_id":"68c5f154-92ac-4620-829b-1a6610cfa673","year":2020},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.919278Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:5136cf8e8ac295fbe0611275dc349299fe17472e820eae3f8d061d65ee9304c2","observation_id":"19f5b359-332b-4f1e-9dd1-4579c83a7168","resolution":{"observed_at":"2026-08-12T15:33:31.843077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.822464Z","title":"DI- RECT: Direct and indirect responses in conversational text corpus","venue":null,"work_id":"371baff5-a02e-4d84-b622-005d4ee22cec","year":2021},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.953782Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:8f73254ca2c9b3aa066447ebf1a747b87bdabc7a2156d312984e63e7b3092c25","observation_id":"ac6e0274-2e0f-4296-ab3a-dfd7bc45b0bd","resolution":{"observed_at":"2026-08-12T15:33:31.831178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.732182Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":"a11a3f2c-bd6b-496a-b31f-42ba1d9c4df7","year":2022},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.969003Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:ed4e79214da093c7d1ae8ba550496f6ada6ee38eca2bdd581d920cfd97ec8636","observation_id":"3d4ab97b-f7b2-48df-bfd2-effaea1efd81","resolution":{"observed_at":"2026-08-12T15:33:31.795572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.563438Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models,","venue":null,"work_id":"c9bf6173-3db3-4bd4-bea1-a58f71ce8f44","year":null},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.977505Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:1250cab159704e8d0b1eae13501ed1c7457e6dc22d2c901a0681e2834c73ba60","observation_id":"6a1a174a-3c50-46cf-9956-e946f535b7b3","resolution":{"observed_at":"2026-08-12T15:33:31.649099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.549609Z","title":"Qwen2.5-vl technical report, 2025","venue":null,"work_id":"a33452ae-6b38-4e75-91a1-43fdf7eb3e0a","year":2025},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.992645Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:8a9dbfeff72f8a09ebb405ce22492530996cfcd5ecef5f74d34a3f75f38b43a4","observation_id":"64215739-8da2-4f15-85f0-f14fa0a9f0a4","resolution":{"observed_at":"2026-08-12T15:33:31.553501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.534175Z","title":"Chain-of- thought prompting elicits reasoning in large language models","venue":null,"work_id":"dc6bd759-7791-4b85-af79-21407eafc8de","year":2022},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.996424Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:48817980211ab4712b68d7d599d5348c94349756c5f48a69c91e94fcbeabdba3","observation_id":"7039ac4c-e6ae-41e4-ba7f-f40275c4632e","resolution":{"observed_at":"2026-08-12T15:33:31.541019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.463350Z","title":"Social-iq 2.0 challenge: Benchmarking multimodal so- cial understanding","venue":null,"work_id":"9d4b4b20-f696-406e-8faa-c7825db9dd96","year":2023},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:30.000418Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:5bb9cdfcac28ce55ad0461293fa9d487c5eedbf9e08f18a154a0b780fae6da79","observation_id":"2ca64840-700a-4362-9b3c-50a5d6f7dd53","resolution":{"observed_at":"2026-08-12T15:33:31.496197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.389199Z","title":"From recognition to cognition: Visual commonsense reason- ing","venue":null,"work_id":"14112d72-19c9-4fbe-9027-5abbb95b52ea","year":2019},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:30.051774Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:0cb8c276ec15ab9880422e6493a771347edf611b2f04b4e7719e221ac5023745","observation_id":"a38ae968-6e21-4293-a9b3-c11a7db38f49","resolution":{"observed_at":"2026-08-12T15:33:31.422414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.246850Z","title":"Socratic models: Composing zero-shot multimodal reasoning with language","venue":null,"work_id":"98914e29-814f-421f-9a3f-46888fb27d97","year":2023},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:30.117616Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:ec2a3c91eb65cf60ccecdb9c11af2ac673fca7e6e1d8c0aa4ba6898c3c7bf41c","observation_id":"57b16e8c-2461-49c2-abd4-73f33b42913e","resolution":{"observed_at":"2026-08-12T15:33:31.315542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.138385Z","title":"Wein- berger, and Yoav Artzi","venue":null,"work_id":"9bc4773e-954d-46b8-9562-7afdbb731326","year":2020},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:30.201328Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:5d99f15717ab843ca6930acafcf58bbcd2b83561251608116ab24d70f627b498","observation_id":"f0c3630d-05ff-4c7a-a3d6-12295b58a447","resolution":{"observed_at":"2026-08-12T15:33:31.198055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.117273Z","title":"Bad” column while prioritizing those in the “Good","venue":null,"work_id":"c9fb1f0d-b641-46fe-bb71-a18aa57fe968","year":2024},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:30.242988Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:98f53dcbc687ed38feaa2046e4d5aaa2a20645fcf5ae1bec6f4da1994a14d936","observation_id":"e0a86bdf-ff9a-4530-9bb7-513d136e4fa8","resolution":{"observed_at":"2026-08-12T15:33:31.128735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:31.027106Z","title":"Hey person2","venue":null,"work_id":"d77f44fa-e6f5-4754-9ad6-59300dd4dd45","year":null},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:30.299633Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:fcadc4375eb67f48a0a08a4a867ea4ad2f8d0bfa93f458e657075cb47bff92a9","observation_id":"e95b160c-5c97-4ad7-b7a9-b24ed52add92","resolution":{"observed_at":"2026-08-12T15:33:31.076114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1055.54406","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:30.504053Z","title":"open the window","venue":null,"work_id":"c442a362-7fd7-462a-be66-c8caf6e36be7","year":null},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:30.363072Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:25cd9cd70cd5e781704f00686d9d4d5fa9d0eb2f7b935253eb6d3dda83d103a9","observation_id":"b5850ed6-dbe6-48d5-83a4-cb1257283f3f","resolution":{"observed_at":"2026-08-12T15:33:30.538335Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:33:29.401122Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.401122Z"},"links":{"citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:c0926f748bf07e757d2f952e7cb38eadb60283858183ae927debbdb88460d42f","observation_id":"32120be0-7b3a-4d22-861a-b96d80eb6db9","resolution":{"observed_at":"2026-08-12T15:33:29.401122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T11:42:44.706122Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":2,"verified_fuzzy":38},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2411.14137."}