{"as_of":"2026-08-09T16:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6389141a1c076816e23981d92827aa08b10aca78643cafa12d5ebf230121429d","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T08:39:41.730369Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T00:54:58.326785Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T00:54:58.682244Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.21072","last_updated":"2026-07-23T09:04:48Z","snapshot_observed_at":"2026-08-01T08:39:34.039663Z","submitted_at":"2026-07-23T09:04:48Z","title":"Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text","version":1},"cited_work":{"arxiv_id":"2607.21072","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.21072","snapshot_observed_at":"2026-08-05T00:54:58.682244Z","title":"Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text","venue":"cs.CV","work_id":"d6d908ea-efef-46fb-804b-42fbce1e041b","year":2026},"citing_paper":{"arxiv_id":"2608.00490","last_updated":"2026-08-01T07:26:20Z","snapshot_observed_at":"2026-08-09T14:19:26.260112Z","submitted_at":"2026-08-01T07:26:20Z","title":"Image-Space Rule Discovery","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T00:54:58.326785Z"},"links":{"cited_paper":"/paper/2607.21072","citing_paper":"/paper/2608.00490"},"observation_digest":"sha256:8978d8a9988903a6be1e6e4a79d20f314b722d7b83d2fe04be50b656bb98576f","observation_id":"7dc54b9e-9f3e-4f75-a76b-d0ca4a5dc8e9","resolution":{"observed_at":"2026-08-05T00:54:58.688729Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2607.21072/citation-record","integrity":"/paper/2607.21072/integrity","json":"/paper/2607.21072/citation-record.json","paper":"/paper/2607.21072"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-01T08:39:36.172840Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21072","last_updated":"2026-07-23T09:04:48Z","snapshot_observed_at":"2026-08-01T08:39:34.039663Z","submitted_at":"2026-07-23T09:04:48Z","title":"Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:36.172840Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.21072"},"observation_digest":"sha256:ce5460bad16b433cca960325f121f2a1f06fec91d51a8d9f57784539fcaa69a5","observation_id":"751917e2-5586-4b9f-ab71-c3993b054f13","resolution":{"observed_at":"2026-08-01T08:39:36.172840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18235","last_updated":"2024-03-13T21:58:59Z","snapshot_observed_at":"2026-07-06T16:39:32.455002Z","submitted_at":"2023-10-27T16:20:10Z","title":"Davidsonian Scene Graph: Improving Reliability in Fine-grained Evaluation for Text-to-Image Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.18235","snapshot_observed_at":"2026-08-01T08:39:36.595969Z","title":"Wei Chow, Jiageng Mao, Boyi Li, Daniel Seita, Vitor Guizilini, and Yue Wang","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21072","last_updated":"2026-07-23T09:04:48Z","snapshot_observed_at":"2026-08-01T08:39:34.039663Z","submitted_at":"2026-07-23T09:04:48Z","title":"Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:36.595969Z"},"links":{"cited_paper":"/paper/2310.18235","citing_paper":"/paper/2607.21072"},"observation_digest":"sha256:473f283ea9557a51311f86c20a597ab10b7dab35c553447de7cd7d09938cebec","observation_id":"aa48be1d-8c24-4979-8ea7-c6e4f7a090c1","resolution":{"observed_at":"2026-08-01T08:39:36.595969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-07T15:13:13.622286Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-01T08:39:36.784561Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21072","last_updated":"2026-07-23T09:04:48Z","snapshot_observed_at":"2026-08-01T08:39:34.039663Z","submitted_at":"2026-07-23T09:04:48Z","title":"Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:36.784561Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2607.21072"},"observation_digest":"sha256:e3c8ba85680415334b3d1b4647f7f20d745eb755baee4b728be6f2d9367ea26e","observation_id":"cfe40d53-b601-4d15-800a-1e0873088288","resolution":{"observed_at":"2026-08-01T08:39:36.784561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-01T08:39:37.227319Z","title":"Xingyu Fu, Yushi Hu, Bangzheng Li, Yu Feng, Haoyu Wang, Xudong Lin, Dan Roth, Noah A Smith, Wei-Chiu Ma, and Ranjay Krishna","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21072","last_updated":"2026-07-23T09:04:48Z","snapshot_observed_at":"2026-08-01T08:39:34.039663Z","submitted_at":"2026-07-23T09:04:48Z","title":"Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:37.227319Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2607.21072"},"observation_digest":"sha256:3486d42295f9c28919914558ad60c817c92a6fdb0389e6fcb3857e986f3c2352","observation_id":"21c8bbc7-3954-478e-bafd-bb833e4922bd","resolution":{"observed_at":"2026-08-01T08:39:37.227319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.20329","last_updated":"2026-06-03T18:02:24Z","snapshot_observed_at":"2026-07-06T23:06:49.210284Z","submitted_at":"2026-04-22T08:23:48Z","title":"Image Generators are Generalist Vision Learners","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.20329","snapshot_observed_at":"2026-08-01T08:39:37.393050Z","title":"Image generators are generalist vision learners.arXiv preprint arXiv:2604.20329,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21072","last_updated":"2026-07-23T09:04:48Z","snapshot_observed_at":"2026-08-01T08:39:34.039663Z","submitted_at":"2026-07-23T09:04:48Z","title":"Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:37.393050Z"},"links":{"cited_paper":"/paper/2604.20329","citing_paper":"/paper/2607.21072"},"observation_digest":"sha256:1ee2596d19bbc2fa0a016fce8a8605d7894b8ed84aac24397832edb10e7b0144","observation_id":"0450b52d-99f1-4deb-9547-b9dc204e2f84","resolution":{"observed_at":"2026-08-01T08:39:37.393050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21257","last_updated":"2025-03-25T05:46:03Z","snapshot_observed_at":"2026-08-07T17:39:03.240589Z","submitted_at":"2025-02-28T17:30:39Z","title":"RoboBrain: A Unified Brain Model for Robotic Manipulation from Abstract to Concrete","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.21257","snapshot_observed_at":"2026-08-01T08:39:37.870420Z","title":"Robobrain: A unified brain model for robotic manipulation from abstract to concrete.arXiv preprint arXiv:2502.21257,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21072","last_updated":"2026-07-23T09:04:48Z","snapshot_observed_at":"2026-08-01T08:39:34.039663Z","submitted_at":"2026-07-23T09:04:48Z","title":"Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:37.870420Z"},"links":{"cited_paper":"/paper/2502.21257","citing_paper":"/paper/2607.21072"},"observation_digest":"sha256:62e1f6018ed7d4743a8616ac2708694ca4bc3335f25e59eb5b3d1c7a5718b537","observation_id":"6856bfed-fbff-426f-83f5-a7da9ed8eca5","resolution":{"observed_at":"2026-08-01T08:39:37.870420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:38.021033Z","title":"Omnispatial: Towards comprehensive spatial reasoning benchmark for vision language models.arXiv preprint arXiv:2506.03135 ,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21072","last_updated":"2026-07-23T09:04:48Z","snapshot_observed_at":"2026-08-01T08:39:34.039663Z","submitted_at":"2026-07-23T09:04:48Z","title":"Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:38.021033Z"},"links":{"citing_paper":"/paper/2607.21072"},"observation_digest":"sha256:9982a1654ce760f6a719f2dbf3d0ab37d146dd3d2a51e7e0bc5d8664c6b144ff","observation_id":"df4d622e-7669-45e5-9a32-dddcb688a954","resolution":{"observed_at":"2026-08-01T08:39:38.021033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:38.201400Z","title":"Joyai-image: Awakening spatial intelligence in unified multimodal understanding and generation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21072","last_updated":"2026-07-23T09:04:48Z","snapshot_observed_at":"2026-08-01T08:39:34.039663Z","submitted_at":"2026-07-23T09:04:48Z","title":"Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:38.201400Z"},"links":{"citing_paper":"/paper/2607.21072"},"observation_digest":"sha256:fcd4059e328401ed95db927a5e8ad15a3add4b2c4f1fda8412154f0fe4ca9778","observation_id":"3097d538-4df7-47cd-8105-22a90588c10a","resolution":{"observed_at":"2026-08-01T08:39:38.201400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15742","last_updated":"2025-06-24T05:31:03Z","snapshot_observed_at":"2026-07-06T21:44:22.901650Z","submitted_at":"2025-06-17T20:18:23Z","title":"FLUX.1 Kontext: Flow Matching for In-Context Image Generation and Editing in Latent Space","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.15742","snapshot_observed_at":"2026-08-01T08:39:38.403605Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21072","last_updated":"2026-07-23T09:04:48Z","snapshot_observed_at":"2026-08-01T08:39:34.039663Z","submitted_at":"2026-07-23T09:04:48Z","title":"Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:38.403605Z"},"links":{"cited_paper":"/paper/2506.15742","citing_paper":"/paper/2607.21072"},"observation_digest":"sha256:6d3ca2ea6573b176b3f2e2e89cd449e949a01809de291c61cfe8e39191992fa6","observation_id":"cc3edf69-dad9-4353-8630-c22152300c63","resolution":{"observed_at":"2026-08-01T08:39:38.403605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13743","last_updated":"2024-11-03T20:22:32Z","snapshot_observed_at":"2026-07-30T19:48:58.731788Z","submitted_at":"2024-06-19T18:00:07Z","title":"GenAI-Bench: Evaluating and Improving Compositional Text-to-Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13743","snapshot_observed_at":"2026-08-01T08:39:38.560857Z","title":"Genai-bench: Evaluating and improving compositional text-to-visual generation.arXiv preprint arXiv:2406.13743,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21072","last_updated":"2026-07-23T09:04:48Z","snapshot_observed_at":"2026-08-01T08:39:34.039663Z","submitted_at":"2026-07-23T09:04:48Z","title":"Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:38.560857Z"},"links":{"cited_paper":"/paper/2406.13743","citing_paper":"/paper/2607.21072"},"observation_digest":"sha256:c0d890c492eec301ef0f105a52d3ebd2dc0bd14dae61c4e40878c44c762613ec","observation_id":"61260bf7-9534-4614-98bc-bd70f4d3562e","resolution":{"observed_at":"2026-08-01T08:39:38.560857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:38.723115Z","title":"Viewspatial-bench: Evaluating multi-perspective spatial localization in vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21072","last_updated":"2026-07-23T09:04:48Z","snapshot_observed_at":"2026-08-01T08:39:34.039663Z","submitted_at":"2026-07-23T09:04:48Z","title":"Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:38.723115Z"},"links":{"citing_paper":"/paper/2607.21072"},"observation_digest":"sha256:34a9a78ae32d8202f5f6fed0be77cf0c77959f10fa5b9646b45cdd0882066b48","observation_id":"b15d9875-5b1b-46dc-bf3f-38f2e4209192","resolution":{"observed_at":"2026-08-01T08:39:38.723115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:38.919903Z","title":"Ssr: Enhancing depth perception in vision-language models via rationale-guided spatial reasoning.arXiv preprint arXiv:2505.12448,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21072","last_updated":"2026-07-23T09:04:48Z","snapshot_observed_at":"2026-08-01T08:39:34.039663Z","submitted_at":"2026-07-23T09:04:48Z","title":"Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:38.919903Z"},"links":{"citing_paper":"/paper/2607.21072"},"observation_digest":"sha256:55b8a4b16b98755cddc65df78ccc1094f9d101db2509f51e54864d1baa7a4e87","observation_id":"bacd8e71-3b47-47d5-a705-9188e002bd1c","resolution":{"observed_at":"2026-08-01T08:39:38.919903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01805","last_updated":"2025-05-21T09:38:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-02T15:12:17Z","title":"SpaceR: Reinforcing MLLMs in Video Spatial Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01805","snapshot_observed_at":"2026-08-01T08:39:39.240342Z","title":"Roni Paiss, Ariel Ephrat, Omer Tov, Shiran Zada, Inbar Mosseri, Michal Irani, and Tali Dekel","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21072","last_updated":"2026-07-23T09:04:48Z","snapshot_observed_at":"2026-08-01T08:39:34.039663Z","submitted_at":"2026-07-23T09:04:48Z","title":"Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:39.240342Z"},"links":{"cited_paper":"/paper/2504.01805","citing_paper":"/paper/2607.21072"},"observation_digest":"sha256:9d64b5720f185bd7ce73055b43d988d3d086c48d62eb3e9d132a8e9697926a08","observation_id":"0ecfc0cc-3e16-461d-aa21-0829e0c2e238","resolution":{"observed_at":"2026-08-01T08:39:39.240342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:39.342345Z","title":"Sat: Dynamic spatial aptitude training for multimodal language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21072","last_updated":"2026-07-23T09:04:48Z","snapshot_observed_at":"2026-08-01T08:39:34.039663Z","submitted_at":"2026-07-23T09:04:48Z","title":"Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:39.342345Z"},"links":{"citing_paper":"/paper/2607.21072"},"observation_digest":"sha256:0fe8abdd46f38a0570ef5fb9a6bce8fbfec6ee5f7684310f385af922cf0e577e","observation_id":"32aad53a-00ba-4532-a80a-cc3a6becb46d","resolution":{"observed_at":"2026-08-01T08:39:39.342345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20427","last_updated":"2025-12-10T16:37:54Z","snapshot_observed_at":"2026-08-07T08:10:15.764742Z","submitted_at":"2025-09-24T17:59:04Z","title":"Seedream 4.0: Toward Next-generation Multimodal Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.20427","snapshot_observed_at":"2026-08-01T08:39:39.437251Z","title":"Seedream 4.0: Toward next-generation multimodal image generation.arXiv preprint arXiv:2509.20427,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21072","last_updated":"2026-07-23T09:04:48Z","snapshot_observed_at":"2026-08-01T08:39:34.039663Z","submitted_at":"2026-07-23T09:04:48Z","title":"Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:39.437251Z"},"links":{"cited_paper":"/paper/2509.20427","citing_paper":"/paper/2607.21072"},"observation_digest":"sha256:9b0abc64c4042479b64e2b6ab2b0ac100eec67c1ffab0532348343514d2a499c","observation_id":"7f54c391-f3e8-4db5-8355-8b6c97d1afbc","resolution":{"observed_at":"2026-08-01T08:39:39.437251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19707","last_updated":"2025-03-25T14:34:06Z","snapshot_observed_at":"2026-08-07T16:38:11.702011Z","submitted_at":"2025-03-25T14:34:06Z","title":"Mind the Gap: Benchmarking Spatial Reasoning in Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19707","snapshot_observed_at":"2026-08-01T08:39:39.509832Z","title":"Huajie Tan, Enshen Zhou, Zhiyu Li, Yijie Xu, Yuheng Ji, Xiansheng Chen, Cheng Chi, Pengwei Wang, Huizhu Jia, Yulong Ao, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21072","last_updated":"2026-07-23T09:04:48Z","snapshot_observed_at":"2026-08-01T08:39:34.039663Z","submitted_at":"2026-07-23T09:04:48Z","title":"Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:39.509832Z"},"links":{"cited_paper":"/paper/2503.19707","citing_paper":"/paper/2607.21072"},"observation_digest":"sha256:0d18199cda300c8ac5e7f3aedb3dc59a16a9e5da24a2db560d0e28dfb5225716","observation_id":"ce3e6dab-3e1f-4d8f-a056-01001d16d180","resolution":{"observed_at":"2026-08-01T08:39:39.509832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:39.626649Z","title":"Yingbo Tang, Lingfeng Zhang, Shuyi Zhang, Yinuo Zhao, and Xiaoshuai Hao","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21072","last_updated":"2026-07-23T09:04:48Z","snapshot_observed_at":"2026-08-01T08:39:34.039663Z","submitted_at":"2026-07-23T09:04:48Z","title":"Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:39.626649Z"},"links":{"citing_paper":"/paper/2607.21072"},"observation_digest":"sha256:8bb6e436d77b8474a94a6f790b9fe8243faf69c465f6168daed3bd1a79ea3ad5","observation_id":"abf7b80b-6f2e-4bb7-b642-502c0a25c831","resolution":{"observed_at":"2026-08-01T08:39:39.626649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:39.740636Z","title":"org/10.1145/3746027.3758209","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21072","last_updated":"2026-07-23T09:04:48Z","snapshot_observed_at":"2026-08-01T08:39:34.039663Z","submitted_at":"2026-07-23T09:04:48Z","title":"Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:39.740636Z"},"links":{"citing_paper":"/paper/2607.21072"},"observation_digest":"sha256:0fb0ab7829f5b695a114401322f203581760efe27de1b0230f0e5cc2646e09e2","observation_id":"8d4eb2e2-0fdc-4ac0-ab67-deb7ac899a1d","resolution":{"observed_at":"2026-08-01T08:39:39.740636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-08-03T18:50:30.558321Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-08-01T08:39:39.852110Z","title":"16 Shengbang Tong, Ellis Brown, Penghao Wu, Sanghyun Woo, Manoj Middepogu, Sai C Akula, Jihan Yang, Shusheng Yang, Adithya Iyer, Xichen Pan, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21072","last_updated":"2026-07-23T09:04:48Z","snapshot_observed_at":"2026-08-01T08:39:34.039663Z","submitted_at":"2026-07-23T09:04:48Z","title":"Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:39.852110Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2607.21072"},"observation_digest":"sha256:32de594f438fd2991e84c1dfee2bc74eebde0e0125345841444af115ed571156","observation_id":"c1a2063d-680f-4928-86e8-7520052c9167","resolution":{"observed_at":"2026-08-01T08:39:39.852110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:39.988118Z","title":"Mindcube: Spatial mental modeling from limited views, 2026a.https://arxiv.org/abs/2506.21458","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21072","last_updated":"2026-07-23T09:04:48Z","snapshot_observed_at":"2026-08-01T08:39:34.039663Z","submitted_at":"2026-07-23T09:04:48Z","title":"Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:39.988118Z"},"links":{"citing_paper":"/paper/2607.21072"},"observation_digest":"sha256:87fae98334e8898423660247190d5ec75af2b14c5fd2107eab0c4bd64ce57a32","observation_id":"162d9b19-9942-4e80-a14c-7f2a8ed002b9","resolution":{"observed_at":"2026-08-01T08:39:39.988118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13848","snapshot_observed_at":"2026-08-01T08:39:40.120708Z","title":"Diankun Wu, Fangfu Liu, Yi-Hsin Hung, and Yueqi Duan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21072","last_updated":"2026-07-23T09:04:48Z","snapshot_observed_at":"2026-08-01T08:39:34.039663Z","submitted_at":"2026-07-23T09:04:48Z","title":"Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:40.120708Z"},"links":{"cited_paper":"/paper/2410.13848","citing_paper":"/paper/2607.21072"},"observation_digest":"sha256:7b0af94b3e7da84b12905647eb94da9dcd78130994b4452d7edaaefba6e487ec","observation_id":"91b4fefa-9314-4d1d-8710-b28411d75609","resolution":{"observed_at":"2026-08-01T08:39:40.120708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:40.241042Z","title":"Qiucheng Wu, Handong Zhao, Michael Saxon, Trung Bui, William Yang Wang, Yang Zhang, and Shiyu Chang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21072","last_updated":"2026-07-23T09:04:48Z","snapshot_observed_at":"2026-08-01T08:39:34.039663Z","submitted_at":"2026-07-23T09:04:48Z","title":"Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:40.241042Z"},"links":{"citing_paper":"/paper/2607.21072"},"observation_digest":"sha256:8e81f7507d6d854727029a9240a89e5fe7ae71cdcd127cab7e2e1806b3e5ca31","observation_id":"c9d49f14-f828-49f3-b6b7-335078e0de3d","resolution":{"observed_at":"2026-08-01T08:39:40.241042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21471","last_updated":"2026-05-07T07:59:46Z","snapshot_observed_at":"2026-08-02T23:27:20.204280Z","submitted_at":"2025-11-26T15:04:18Z","title":"SpatialBench: Benchmarking Multimodal Large Language Models for Spatial Cognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21471","snapshot_observed_at":"2026-08-01T08:39:40.396402Z","title":"Spatialbench: Benchmarking multimodal large language models for spatial cognition, 2026.https://arxiv.org/abs/2511.21471","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21072","last_updated":"2026-07-23T09:04:48Z","snapshot_observed_at":"2026-08-01T08:39:34.039663Z","submitted_at":"2026-07-23T09:04:48Z","title":"Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:40.396402Z"},"links":{"cited_paper":"/paper/2511.21471","citing_paper":"/paper/2607.21072"},"observation_digest":"sha256:af3e44e06ee6d6b826ef567e6d8c61405934ed61552fec8e18639c5c458db3eb","observation_id":"c2253254-bb0b-4b8b-b93a-96a24195c4dd","resolution":{"observed_at":"2026-08-01T08:39:40.396402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:40.520878Z","title":"Sphere: Unveiling spatial blind spots in vision-language models through hierarchical evaluation.ACL, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21072","last_updated":"2026-07-23T09:04:48Z","snapshot_observed_at":"2026-08-01T08:39:34.039663Z","submitted_at":"2026-07-23T09:04:48Z","title":"Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:40.520878Z"},"links":{"citing_paper":"/paper/2607.21072"},"observation_digest":"sha256:63fe7003ae81904b964bb3acf9b99f69c283111bd8e0d39dc04e86752f5fe988","observation_id":"d395aebd-a326-4e01-9ce4-ee26ee7bef62","resolution":{"observed_at":"2026-08-01T08:39:40.520878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.28548","snapshot_observed_at":"2026-08-01T08:39:40.704498Z","title":"Xu Zheng, Zihao Dongfang, Lutao Jiang, Boyuan Zheng, Yulong Guo, Zhenquan Zhang, Giuliano Albanese, Runyi Yang, Mengjiao Ma, Zixin Zhang, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21072","last_updated":"2026-07-23T09:04:48Z","snapshot_observed_at":"2026-08-01T08:39:34.039663Z","submitted_at":"2026-07-23T09:04:48Z","title":"Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:40.704498Z"},"links":{"cited_paper":"/paper/2605.28548","citing_paper":"/paper/2607.21072"},"observation_digest":"sha256:ebd2a55a4de58b9b5f1f4de16b1f7f3a3dcc27e98d6e74a7759d744a36f9c7ab","observation_id":"9a094702-8da5-4b8d-b8e7-8868f3660ee5","resolution":{"observed_at":"2026-08-01T08:39:40.704498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:40.853401Z","title":"Roborefer: Towards spatial referring with reasoning in vision-language models for robotics","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21072","last_updated":"2026-07-23T09:04:48Z","snapshot_observed_at":"2026-08-01T08:39:34.039663Z","submitted_at":"2026-07-23T09:04:48Z","title":"Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:40.853401Z"},"links":{"citing_paper":"/paper/2607.21072"},"observation_digest":"sha256:c25f23d47ddca25303ac75cfc78937119bcba658c1c3226d07fc4ec47d5c7eae","observation_id":"275e632a-55d9-4624-9b16-655157e579a5","resolution":{"observed_at":"2026-08-01T08:39:40.853401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:41.054054Z","title":"• Appendix B documents data sources, schema, and quality control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21072","last_updated":"2026-07-23T09:04:48Z","snapshot_observed_at":"2026-08-01T08:39:34.039663Z","submitted_at":"2026-07-23T09:04:48Z","title":"Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:41.054054Z"},"links":{"citing_paper":"/paper/2607.21072"},"observation_digest":"sha256:3adbc77bc1288329d4feda4cad23762877b068e97e522dfabcb71bae038a5aa0","observation_id":"719611ca-6e89-463f-8885-d5f9cfc487d4","resolution":{"observed_at":"2026-08-01T08:39:41.054054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:41.232662Z","title":"GPT-5.4 OpenAI-compatible chat API; request model gpt-5.4; direct structured answer; deterministic request settings where supported","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21072","last_updated":"2026-07-23T09:04:48Z","snapshot_observed_at":"2026-08-01T08:39:34.039663Z","submitted_at":"2026-07-23T09:04:48Z","title":"Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:41.232662Z"},"links":{"citing_paper":"/paper/2607.21072"},"observation_digest":"sha256:ef6b151118514cd16526243286c5c519b6533e6058987854a8a36653578bd0a8","observation_id":"e0f07522-73ef-4bab-822e-ab3c1a7b9294","resolution":{"observed_at":"2026-08-01T08:39:41.232662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:41.411567Z","title":"VLM-3R-7B; SpatialRGPT-8B; Spatial-MLLM; SpatialBot-3B (Fan et al., 2025; Cheng et al., 2024; Wu et al., 2025b; Cai et al.,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21072","last_updated":"2026-07-23T09:04:48Z","snapshot_observed_at":"2026-08-01T08:39:34.039663Z","submitted_at":"2026-07-23T09:04:48Z","title":"Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:41.411567Z"},"links":{"citing_paper":"/paper/2607.21072"},"observation_digest":"sha256:3dd8376ea5b5c8bb49f77ad3f0b8c23864f32c3f153309db59b3dbb75614b45b","observation_id":"80b07f73-2746-4696-a9e8-5840ce7f5e30","resolution":{"observed_at":"2026-08-01T08:39:41.411567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:41.612334Z","title":"SenseNova-Vision-7B-MoT; Janus-Pro-7B; Janus-1.3B (Han et al., 2026; Chen et al., 2025; Wu et al.,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21072","last_updated":"2026-07-23T09:04:48Z","snapshot_observed_at":"2026-08-01T08:39:34.039663Z","submitted_at":"2026-07-23T09:04:48Z","title":"Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:41.612334Z"},"links":{"citing_paper":"/paper/2607.21072"},"observation_digest":"sha256:2f81ab8ba88972ffec2cc43a8542d133b5d821e8ec768fca00e41a0f3f8afab2","observation_id":"d6a9c072-c79c-434e-83f4-5eeea6c1547f","resolution":{"observed_at":"2026-08-01T08:39:41.612334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:41.730369Z","title":"32 Table 17 continued","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21072","last_updated":"2026-07-23T09:04:48Z","snapshot_observed_at":"2026-08-01T08:39:34.039663Z","submitted_at":"2026-07-23T09:04:48Z","title":"Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text","version":1},"reference_index":1024,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:41.730369Z"},"links":{"citing_paper":"/paper/2607.21072"},"observation_digest":"sha256:ebff8a327903eb44684dc4741e8252abc203f253fa62447080132d121df5caff","observation_id":"362e470c-d8fc-4a98-83f6-52048146213b","resolution":{"observed_at":"2026-08-01T08:39:41.730369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.06560","snapshot_observed_at":"2026-08-01T08:39:37.738395Z","title":"Vision as unified multimodal generation, 2026.https://arxiv.org/abs/2607.06560","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21072","last_updated":"2026-07-23T09:04:48Z","snapshot_observed_at":"2026-08-01T08:39:34.039663Z","submitted_at":"2026-07-23T09:04:48Z","title":"Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:37.738395Z"},"links":{"cited_paper":"/paper/2607.06560","citing_paper":"/paper/2607.21072"},"observation_digest":"sha256:8a6fa9e334d079e67b551ca9c0e808b63edb42a078ec2f039d1b78423c82b360","observation_id":"23f1e4ba-6321-4b1e-a023-24f3724d5ea7","resolution":{"observed_at":"2026-08-01T08:39:37.738395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10015","last_updated":"2023-10-27T17:24:04Z","snapshot_observed_at":"2026-07-06T14:32:48.360720Z","submitted_at":"2022-12-20T06:03:51Z","title":"Benchmarking Spatial Relationships in Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10015","snapshot_observed_at":"2026-08-01T08:39:37.518805Z","title":"Benchmarking spatial relationships in text-to-image generation.arXiv preprint arXiv:2212.10015 ,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21072","last_updated":"2026-07-23T09:04:48Z","snapshot_observed_at":"2026-08-01T08:39:34.039663Z","submitted_at":"2026-07-23T09:04:48Z","title":"Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:37.518805Z"},"links":{"cited_paper":"/paper/2212.10015","citing_paper":"/paper/2607.21072"},"observation_digest":"sha256:430a7c7032b73f4189823d5f62dbb8b2569af20a8ce7bca00ce924bd44cff342","observation_id":"d397bc5e-c954-44b6-a872-c5f290657a1a","resolution":{"observed_at":"2026-08-01T08:39:37.518805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-01T08:39:36.464785Z","title":"Janus-pro: Unified multimodal understanding and generation with data and model scaling.arXiv preprint arXiv:2501.17811 ,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21072","last_updated":"2026-07-23T09:04:48Z","snapshot_observed_at":"2026-08-01T08:39:34.039663Z","submitted_at":"2026-07-23T09:04:48Z","title":"Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:36.464785Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2607.21072"},"observation_digest":"sha256:31072a301be68d07b1095bebbd6650fadff6b38bc896deaff15da46770bb4823","observation_id":"6892ec34-3a4b-4b7b-9bc9-800038bb5662","resolution":{"observed_at":"2026-08-01T08:39:36.464785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-01T08:39:36.317366Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21072","last_updated":"2026-07-23T09:04:48Z","snapshot_observed_at":"2026-08-01T08:39:34.039663Z","submitted_at":"2026-07-23T09:04:48Z","title":"Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:36.317366Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2607.21072"},"observation_digest":"sha256:942c8775c6d4ea12d505b23a7e975c388d68900bbb7010e20dacda9d950036e4","observation_id":"7262283c-de5f-4f5b-b544-fee1b27583e0","resolution":{"observed_at":"2026-08-01T08:39:36.317366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:37.090693Z","title":"14 Chaorui Deng, Deyao Zhu, Kunchang Li, Chenhui Gou, Feng Li, Zeyu Wang, Shu Zhong, Weihao Yu, Xiaonan Nie, Ziang Song, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21072","last_updated":"2026-07-23T09:04:48Z","snapshot_observed_at":"2026-08-01T08:39:34.039663Z","submitted_at":"2026-07-23T09:04:48Z","title":"Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:37.090693Z"},"links":{"citing_paper":"/paper/2607.21072"},"observation_digest":"sha256:cbde5eedbea363147212dd7b4acc9899c96ac3167e373860ad310fca5f5e8c12","observation_id":"32c9d74b-f98e-463d-964f-e35f4f97a71d","resolution":{"observed_at":"2026-08-01T08:39:37.090693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.21072","last_updated":"2026-07-23T09:04:48Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-01T08:39:34.039663Z","submitted_at":"2026-07-23T09:04:48Z","title":"Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 1 inbound Pith citation observation for arXiv:2607.21072."}