{"as_of":"2026-08-19T18:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:645de361697309331563fce835c30d2ab1128cb199ec395e212873e598baebda","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T04:59:40.093942Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.18224/citation-record","integrity":"/paper/2412.18224/integrity","json":"/paper/2412.18224/citation-record.json","paper":"/paper/2412.18224"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-17T13:04:04.064087Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-11T04:59:39.940271Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18224","last_updated":"2024-12-24T07:13:17Z","snapshot_observed_at":"2026-08-15T04:42:40.391400Z","submitted_at":"2024-12-24T07:13:17Z","title":"Expand VSR Benchmark for VLLM to Expertize in Spatial Rules","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T04:59:39.940271Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2412.18224"},"observation_digest":"sha256:a93058e54a4ab136a0a46480068ee6f9a2cd60c710488de225e4fd1a9ddab3ea","observation_id":"a12ca233-a84d-43e0-8129-cf4e0d1198dc","resolution":{"observed_at":"2026-08-11T04:59:39.940271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-08-13T18:58:34.541884Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-11T04:59:39.947577Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18224","last_updated":"2024-12-24T07:13:17Z","snapshot_observed_at":"2026-08-15T04:42:40.391400Z","submitted_at":"2024-12-24T07:13:17Z","title":"Expand VSR Benchmark for VLLM to Expertize in Spatial Rules","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T04:59:39.947577Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2412.18224"},"observation_digest":"sha256:75e486c1983183f5e63595dd3c751957af02aa68c3368ee4f3dad1e88e9e36b3","observation_id":"21a104ab-71e9-4c69-ae84-22df2ea02b71","resolution":{"observed_at":"2026-08-11T04:59:39.947577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-11T04:59:39.953253Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18224","last_updated":"2024-12-24T07:13:17Z","snapshot_observed_at":"2026-08-15T04:42:40.391400Z","submitted_at":"2024-12-24T07:13:17Z","title":"Expand VSR Benchmark for VLLM to Expertize in Spatial Rules","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T04:59:39.953253Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2412.18224"},"observation_digest":"sha256:02b0aaa440c0bdce8903804882af3e75789167af2b3e1677756491c0c4fd9957","observation_id":"0dd6296c-12b3-4b62-937a-93348021ee57","resolution":{"observed_at":"2026-08-11T04:59:39.953253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:59:39.959509Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.18224","last_updated":"2024-12-24T07:13:17Z","snapshot_observed_at":"2026-08-15T04:42:40.391400Z","submitted_at":"2024-12-24T07:13:17Z","title":"Expand VSR Benchmark for VLLM to Expertize in Spatial Rules","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T04:59:39.959509Z"},"links":{"citing_paper":"/paper/2412.18224"},"observation_digest":"sha256:0902470e646b4e1d145a09e8729b3e3e3eeccf3daa29dd6092e34c5b2c19a41d","observation_id":"c7c6ef93-46be-4db1-8fc0-f0134ab71dee","resolution":{"observed_at":"2026-08-11T04:59:39.959509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07865","last_updated":"2024-05-30T13:08:48Z","snapshot_observed_at":"2026-08-16T14:19:15.096234Z","submitted_at":"2024-02-12T18:21:14Z","title":"Prismatic VLMs: Investigating the Design Space of Visually-Conditioned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07865","snapshot_observed_at":"2026-08-11T04:59:39.965663Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18224","last_updated":"2024-12-24T07:13:17Z","snapshot_observed_at":"2026-08-15T04:42:40.391400Z","submitted_at":"2024-12-24T07:13:17Z","title":"Expand VSR Benchmark for VLLM to Expertize in Spatial Rules","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T04:59:39.965663Z"},"links":{"cited_paper":"/paper/2402.07865","citing_paper":"/paper/2412.18224"},"observation_digest":"sha256:6ec8f506cdb5ee464a594cbd6896b8409352ee6de51af47a7ac9e05134f7c5e5","observation_id":"f8056d1f-9c45-4b18-8b8b-dd4881d7635d","resolution":{"observed_at":"2026-08-11T04:59:39.965663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-11T04:59:39.971453Z","title":"C.; Lo, W.-Y.; Dollár, P.; and Girshick, R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18224","last_updated":"2024-12-24T07:13:17Z","snapshot_observed_at":"2026-08-15T04:42:40.391400Z","submitted_at":"2024-12-24T07:13:17Z","title":"Expand VSR Benchmark for VLLM to Expertize in Spatial Rules","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T04:59:39.971453Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2412.18224"},"observation_digest":"sha256:a12be322458bfbff1319ce0e2d7c5d9069cd7ee1441ac843ee2f8c3db72ed67b","observation_id":"d7b6a9f6-91a0-44f6-bffe-1aebd65ef34c","resolution":{"observed_at":"2026-08-11T04:59:39.971453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:59:39.978402Z","title":"A.; et al","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.18224","last_updated":"2024-12-24T07:13:17Z","snapshot_observed_at":"2026-08-15T04:42:40.391400Z","submitted_at":"2024-12-24T07:13:17Z","title":"Expand VSR Benchmark for VLLM to Expertize in Spatial Rules","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T04:59:39.978402Z"},"links":{"citing_paper":"/paper/2412.18224"},"observation_digest":"sha256:dba5556562f68d0b117c1dd08854536cdfeec79f26e531a98c1a60b875a5eda8","observation_id":"eb50f5d3-c5eb-4a1f-94f5-7c78f3f039c3","resolution":{"observed_at":"2026-08-11T04:59:39.978402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-11T04:59:39.984505Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18224","last_updated":"2024-12-24T07:13:17Z","snapshot_observed_at":"2026-08-15T04:42:40.391400Z","submitted_at":"2024-12-24T07:13:17Z","title":"Expand VSR Benchmark for VLLM to Expertize in Spatial Rules","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T04:59:39.984505Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2412.18224"},"observation_digest":"sha256:58ff1d610584418fb47345ca121a24e7bc9a63409bef5ea2af4b27d25ed26d96","observation_id":"ac5a35c9-b026-4bf9-b7f4-c0acf514aa0f","resolution":{"observed_at":"2026-08-11T04:59:39.984505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:59:39.991265Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.18224","last_updated":"2024-12-24T07:13:17Z","snapshot_observed_at":"2026-08-15T04:42:40.391400Z","submitted_at":"2024-12-24T07:13:17Z","title":"Expand VSR Benchmark for VLLM to Expertize in Spatial Rules","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T04:59:39.991265Z"},"links":{"citing_paper":"/paper/2412.18224"},"observation_digest":"sha256:fd0d56a2e952c79595622bfc5812879e1429b7e550dcb52ac4f440015435d1b1","observation_id":"537fc083-8379-4b40-998a-348decc9ae71","resolution":{"observed_at":"2026-08-11T04:59:39.991265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.00363","last_updated":"2023-03-22T15:42:50Z","snapshot_observed_at":"2026-08-16T17:03:26.678147Z","submitted_at":"2022-04-30T23:03:49Z","title":"Visual Spatial Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.00363","snapshot_observed_at":"2026-08-11T04:59:39.999600Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18224","last_updated":"2024-12-24T07:13:17Z","snapshot_observed_at":"2026-08-15T04:42:40.391400Z","submitted_at":"2024-12-24T07:13:17Z","title":"Expand VSR Benchmark for VLLM to Expertize in Spatial Rules","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T04:59:39.999600Z"},"links":{"cited_paper":"/paper/2205.00363","citing_paper":"/paper/2412.18224"},"observation_digest":"sha256:e31423453cccf4aa259881a097ab3bc0186639a8792a47bc17f6b8b19904d8ae","observation_id":"e4212fd5-fa7b-476d-889f-a33958c21491","resolution":{"observed_at":"2026-08-11T04:59:39.999600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:59:40.006951Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18224","last_updated":"2024-12-24T07:13:17Z","snapshot_observed_at":"2026-08-15T04:42:40.391400Z","submitted_at":"2024-12-24T07:13:17Z","title":"Expand VSR Benchmark for VLLM to Expertize in Spatial Rules","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T04:59:40.006951Z"},"links":{"citing_paper":"/paper/2412.18224"},"observation_digest":"sha256:d44714ef3e8610cbdd1c8c90bdd5dbb287fa20d21976ff87f0dc20161ddbefb2","observation_id":"e26cc8a8-95f2-4d03-a0c9-b7f95cca870f","resolution":{"observed_at":"2026-08-11T04:59:40.006951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-08-15T02:35:59.111911Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-11T04:59:40.016681Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18224","last_updated":"2024-12-24T07:13:17Z","snapshot_observed_at":"2026-08-15T04:42:40.391400Z","submitted_at":"2024-12-24T07:13:17Z","title":"Expand VSR Benchmark for VLLM to Expertize in Spatial Rules","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T04:59:40.016681Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2412.18224"},"observation_digest":"sha256:a70c231146aec71f0a476a095ef36779843c46bd8f3a7d3c329dd0067efa3d46","observation_id":"5c79fe31-5031-4125-9be9-95366177cbcf","resolution":{"observed_at":"2026-08-11T04:59:40.016681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-11T04:59:40.022890Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18224","last_updated":"2024-12-24T07:13:17Z","snapshot_observed_at":"2026-08-15T04:42:40.391400Z","submitted_at":"2024-12-24T07:13:17Z","title":"Expand VSR Benchmark for VLLM to Expertize in Spatial Rules","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T04:59:40.022890Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2412.18224"},"observation_digest":"sha256:2f04f2cc160fbc8097909120087ed15ac4ce615252b358666a852b5ee13c090d","observation_id":"b1a014e2-0da5-473c-9d64-f15ea89af49e","resolution":{"observed_at":"2026-08-11T04:59:40.022890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00253","last_updated":"2024-05-06T01:10:01Z","snapshot_observed_at":"2026-08-17T09:37:14.144521Z","submitted_at":"2024-02-01T00:33:21Z","title":"A Survey on Hallucination in Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00253","snapshot_observed_at":"2026-08-11T04:59:40.029055Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18224","last_updated":"2024-12-24T07:13:17Z","snapshot_observed_at":"2026-08-15T04:42:40.391400Z","submitted_at":"2024-12-24T07:13:17Z","title":"Expand VSR Benchmark for VLLM to Expertize in Spatial Rules","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T04:59:40.029055Z"},"links":{"cited_paper":"/paper/2402.00253","citing_paper":"/paper/2412.18224"},"observation_digest":"sha256:c5c1e01c567f8b89bafb6d886e0d715bde9d4cdb766b6d7041f44db32c7e791e","observation_id":"5509f950-34aa-4863-bea6-4a349e03f997","resolution":{"observed_at":"2026-08-11T04:59:40.029055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-08-17T03:48:18.599994Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-11T04:59:40.035011Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18224","last_updated":"2024-12-24T07:13:17Z","snapshot_observed_at":"2026-08-15T04:42:40.391400Z","submitted_at":"2024-12-24T07:13:17Z","title":"Expand VSR Benchmark for VLLM to Expertize in Spatial Rules","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T04:59:40.035011Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2412.18224"},"observation_digest":"sha256:6443d5b0a5a16b9113d88423459043dc10a1ee3de0e31f8846365276dbc4cbe9","observation_id":"95b93937-8e49-4e0b-8f55-c452f26a8325","resolution":{"observed_at":"2026-08-11T04:59:40.035011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-08-16T18:14:04.403890Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09611","snapshot_observed_at":"2026-08-11T04:59:40.040560Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18224","last_updated":"2024-12-24T07:13:17Z","snapshot_observed_at":"2026-08-15T04:42:40.391400Z","submitted_at":"2024-12-24T07:13:17Z","title":"Expand VSR Benchmark for VLLM to Expertize in Spatial Rules","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T04:59:40.040560Z"},"links":{"cited_paper":"/paper/2403.09611","citing_paper":"/paper/2412.18224"},"observation_digest":"sha256:a8acca0ce6e220e208a8a0c865e0d10eb522a53e9cfc7d8d986abd7c04fedeec","observation_id":"b2d656d4-f509-4e4b-a15d-3ca5d9e54b11","resolution":{"observed_at":"2026-08-11T04:59:40.040560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-17T13:03:40.359628Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-11T04:59:40.046035Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18224","last_updated":"2024-12-24T07:13:17Z","snapshot_observed_at":"2026-08-15T04:42:40.391400Z","submitted_at":"2024-12-24T07:13:17Z","title":"Expand VSR Benchmark for VLLM to Expertize in Spatial Rules","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T04:59:40.046035Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2412.18224"},"observation_digest":"sha256:9795bd638e50db4fa7b4cecf8574291e4c87a7c5f47817b0904f17088ce53765","observation_id":"fd130baf-7745-49e6-a1ce-501512b0bbb7","resolution":{"observed_at":"2026-08-11T04:59:40.046035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-08-14T22:54:08.184266Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-11T04:59:40.052543Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18224","last_updated":"2024-12-24T07:13:17Z","snapshot_observed_at":"2026-08-15T04:42:40.391400Z","submitted_at":"2024-12-24T07:13:17Z","title":"Expand VSR Benchmark for VLLM to Expertize in Spatial Rules","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T04:59:40.052543Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2412.18224"},"observation_digest":"sha256:51417dd4c7efaf980e91edeafb1d36b675b5c85486d28825a612a6e945920392","observation_id":"fae0410b-d515-45e9-8e77-1d61e6915e7d","resolution":{"observed_at":"2026-08-11T04:59:40.052543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-11T04:59:40.058409Z","title":"W.; Hallacy, C.; Ramesh, A.; Goh, G.; Agarwal, S.; Sastry, G.; Askell, A.; Mishkin, P.; Clark, J.; Krueger, G.; and Sutskever, I","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18224","last_updated":"2024-12-24T07:13:17Z","snapshot_observed_at":"2026-08-15T04:42:40.391400Z","submitted_at":"2024-12-24T07:13:17Z","title":"Expand VSR Benchmark for VLLM to Expertize in Spatial Rules","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T04:59:40.058409Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2412.18224"},"observation_digest":"sha256:f08f8dcca34fc3de3bff7fc6be32638cf8ba69df01cbe8e99b05f5197509d51f","observation_id":"50f97423-349f-4132-a89d-00a828ac26c2","resolution":{"observed_at":"2026-08-11T04:59:40.058409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-08-15T07:01:36.213052Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-11T04:59:40.064297Z","title":"C.; Yang, J.; Yang, S.; Iyer, A.; Pan, X.; et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18224","last_updated":"2024-12-24T07:13:17Z","snapshot_observed_at":"2026-08-15T04:42:40.391400Z","submitted_at":"2024-12-24T07:13:17Z","title":"Expand VSR Benchmark for VLLM to Expertize in Spatial Rules","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T04:59:40.064297Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2412.18224"},"observation_digest":"sha256:b57a86e4c2996a02f308de613eafe796f62b1204cc7232d957f47b20562cdf68","observation_id":"6034182a-5eaf-40a7-96ce-3fb835466e92","resolution":{"observed_at":"2026-08-11T04:59:40.064297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:59:40.500198Z","title":null,"venue":null,"work_id":"9db7b55b-50e6-4823-bad1-b790937ce241","year":2024},"citing_paper":{"arxiv_id":"2412.18224","last_updated":"2024-12-24T07:13:17Z","snapshot_observed_at":"2026-08-15T04:42:40.391400Z","submitted_at":"2024-12-24T07:13:17Z","title":"Expand VSR Benchmark for VLLM to Expertize in Spatial Rules","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T04:59:40.070841Z"},"links":{"citing_paper":"/paper/2412.18224"},"observation_digest":"sha256:bc279848617ac47c8751de59af95a73da33c8ae932c31568681ce9c38e33f0d1","observation_id":"525aad55-e554-48e1-abdd-d2b9dd3f2352","resolution":{"observed_at":"2026-08-11T04:59:40.507251Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15343","last_updated":"2023-09-27T12:05:41Z","snapshot_observed_at":"2026-07-06T15:08:30.190912Z","submitted_at":"2023-03-27T15:53:01Z","title":"Sigmoid Loss for Language Image Pre-Training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15343","snapshot_observed_at":"2026-08-11T04:59:40.075766Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18224","last_updated":"2024-12-24T07:13:17Z","snapshot_observed_at":"2026-08-15T04:42:40.391400Z","submitted_at":"2024-12-24T07:13:17Z","title":"Expand VSR Benchmark for VLLM to Expertize in Spatial Rules","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T04:59:40.075766Z"},"links":{"cited_paper":"/paper/2303.15343","citing_paper":"/paper/2412.18224"},"observation_digest":"sha256:7f90400281478df01a02d6d503d91da5906382a4b5035ead78cbd782e4e516d7","observation_id":"2aadb8f1-789f-420b-9028-e3c0f3345b5e","resolution":{"observed_at":"2026-08-11T04:59:40.075766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17770","last_updated":"2024-06-27T02:12:28Z","snapshot_observed_at":"2026-08-16T13:39:40.221565Z","submitted_at":"2024-06-25T17:55:11Z","title":"MG-LLaVA: Towards Multi-Granularity Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17770","snapshot_observed_at":"2026-08-11T04:59:40.081757Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18224","last_updated":"2024-12-24T07:13:17Z","snapshot_observed_at":"2026-08-15T04:42:40.391400Z","submitted_at":"2024-12-24T07:13:17Z","title":"Expand VSR Benchmark for VLLM to Expertize in Spatial Rules","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T04:59:40.081757Z"},"links":{"cited_paper":"/paper/2406.17770","citing_paper":"/paper/2412.18224"},"observation_digest":"sha256:532adaa7b160266d67cbf1ec8116647ab3d27ce077ea6336ca6f39b4e851ecb0","observation_id":"cbaed8c9-f12a-41a4-8ab7-b81e087a8482","resolution":{"observed_at":"2026-08-11T04:59:40.081757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:59:40.087657Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18224","last_updated":"2024-12-24T07:13:17Z","snapshot_observed_at":"2026-08-15T04:42:40.391400Z","submitted_at":"2024-12-24T07:13:17Z","title":"Expand VSR Benchmark for VLLM to Expertize in Spatial Rules","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T04:59:40.087657Z"},"links":{"citing_paper":"/paper/2412.18224"},"observation_digest":"sha256:f6d7e4bdbbfd7df907a72f9ab32178893fedc4a19aae563ccfaae0efa7f55612","observation_id":"d8be22c0-5c69-4235-8daa-630f86303e3c","resolution":{"observed_at":"2026-08-11T04:59:40.087657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:59:40.093942Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18224","last_updated":"2024-12-24T07:13:17Z","snapshot_observed_at":"2026-08-15T04:42:40.391400Z","submitted_at":"2024-12-24T07:13:17Z","title":"Expand VSR Benchmark for VLLM to Expertize in Spatial Rules","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T04:59:40.093942Z"},"links":{"citing_paper":"/paper/2412.18224"},"observation_digest":"sha256:256ef4c9c9aaf865d858b386556204891da91b6c30d738261c0db75feb20e160","observation_id":"028e6688-0528-4ea9-8c96-c193feeb210b","resolution":{"observed_at":"2026-08-11T04:59:40.093942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.18224","last_updated":"2024-12-24T07:13:17Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T04:42:40.391400Z","submitted_at":"2024-12-24T07:13:17Z","title":"Expand VSR Benchmark for VLLM to Expertize in Spatial Rules"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 0 inbound Pith citation observations for arXiv:2412.18224."}