{"as_of":"2026-08-18T06:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7970975c34ece67338b4d126d0d1c907649a2bb93b3d2b68e5fa4ea40b279659","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T17:09:48.465115Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.13964/citation-record","integrity":"/paper/2501.13964/integrity","json":"/paper/2501.13964/citation-record.json","paper":"/paper/2501.13964"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:09:49.017186Z","title":"Introducing the next generation of Claude","venue":null,"work_id":"d2af8c44-ab03-4a3e-a6bc-5d1768144f99","year":2024},"citing_paper":{"arxiv_id":"2501.13964","last_updated":"2025-02-01T20:27:00Z","snapshot_observed_at":"2026-08-12T15:01:12.682271Z","submitted_at":"2025-01-21T23:07:03Z","title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T17:09:48.311927Z"},"links":{"citing_paper":"/paper/2501.13964"},"observation_digest":"sha256:87351ebf0cc196d8a23a8c100acf4446dc5bde5dd7d42155f38c87b05a9af6e3","observation_id":"e9a62dea-d8e9-4f80-9c3f-95337e335358","resolution":{"observed_at":"2026-08-10T17:09:49.023341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:09:48.996718Z","title":"Bitton-Guetta, Y","venue":null,"work_id":"7af52b73-5dad-4475-bb39-d16da152d8d6","year":2023},"citing_paper":{"arxiv_id":"2501.13964","last_updated":"2025-02-01T20:27:00Z","snapshot_observed_at":"2026-08-12T15:01:12.682271Z","submitted_at":"2025-01-21T23:07:03Z","title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T17:09:48.321028Z"},"links":{"citing_paper":"/paper/2501.13964"},"observation_digest":"sha256:7cc8249f5fccd33aa8dc61d038d5862041430e870b2d5ef551ac8cc73e95ab60","observation_id":"6048df04-d97c-4d88-97a4-9fd8448d451c","resolution":{"observed_at":"2026-08-10T17:09:49.004374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13642","last_updated":"2025-03-19T05:09:14Z","snapshot_observed_at":"2026-08-16T13:41:24.654042Z","submitted_at":"2024-06-19T15:41:30Z","title":"SpatialBot: Precise Spatial Understanding with Vision Language Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13642","snapshot_observed_at":"2026-08-10T17:09:48.328251Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13964","last_updated":"2025-02-01T20:27:00Z","snapshot_observed_at":"2026-08-12T15:01:12.682271Z","submitted_at":"2025-01-21T23:07:03Z","title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T17:09:48.328251Z"},"links":{"cited_paper":"/paper/2406.13642","citing_paper":"/paper/2501.13964"},"observation_digest":"sha256:2e8e519403fdcdbb140196b7932739985b57ab6410ebeb25184d4956191c46b7","observation_id":"542845cb-54ef-43e4-9204-295821593865","resolution":{"observed_at":"2026-08-10T17:09:48.328251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15663","last_updated":"2023-12-25T09:13:18Z","snapshot_observed_at":"2026-08-16T14:31:47.257951Z","submitted_at":"2023-12-25T09:13:18Z","title":"IQAGPT: Image Quality Assessment with Vision-language and ChatGPT Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15663","snapshot_observed_at":"2026-08-10T17:09:48.334099Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13964","last_updated":"2025-02-01T20:27:00Z","snapshot_observed_at":"2026-08-12T15:01:12.682271Z","submitted_at":"2025-01-21T23:07:03Z","title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T17:09:48.334099Z"},"links":{"cited_paper":"/paper/2312.15663","citing_paper":"/paper/2501.13964"},"observation_digest":"sha256:924b782b18d0cb43ac4819d2b386c9670d3e3fb428d19e9dd23733e59c663d06","observation_id":"c17b7471-dd61-4aab-865d-69d14317f968","resolution":{"observed_at":"2026-08-10T17:09:48.334099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:09:48.979523Z","title":"AR shopping for glasses, 2024","venue":null,"work_id":"97d9d109-f9bc-4022-8f58-3c7bd26bf7d5","year":2024},"citing_paper":{"arxiv_id":"2501.13964","last_updated":"2025-02-01T20:27:00Z","snapshot_observed_at":"2026-08-12T15:01:12.682271Z","submitted_at":"2025-01-21T23:07:03Z","title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T17:09:48.339512Z"},"links":{"citing_paper":"/paper/2501.13964"},"observation_digest":"sha256:34f283180055e3afe52aa1fdccf9c8415b0b3818721ad609afcf41bb9f49a308","observation_id":"7d9c6339-4de4-4d00-a8f4-525916618e96","resolution":{"observed_at":"2026-08-10T17:09:48.984466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:09:48.963223Z","title":null,"venue":null,"work_id":"cad69db3-0c00-4256-b47b-0646382b8cf0","year":2022},"citing_paper":{"arxiv_id":"2501.13964","last_updated":"2025-02-01T20:27:00Z","snapshot_observed_at":"2026-08-12T15:01:12.682271Z","submitted_at":"2025-01-21T23:07:03Z","title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T17:09:48.346299Z"},"links":{"citing_paper":"/paper/2501.13964"},"observation_digest":"sha256:0f76e0dcc1787f9cdbd30109c67106fb5ffce02d52ef99990ab64b95b3c52d2b","observation_id":"87182d6f-ae21-4b31-8de6-d7dfc5f79c4f","resolution":{"observed_at":"2026-08-10T17:09:48.968206Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:09:48.945111Z","title":"Gemini: A family of highly capable multimodal models","venue":null,"work_id":"a796b9fd-e8ba-401b-b917-496360d4ffed","year":2024},"citing_paper":{"arxiv_id":"2501.13964","last_updated":"2025-02-01T20:27:00Z","snapshot_observed_at":"2026-08-12T15:01:12.682271Z","submitted_at":"2025-01-21T23:07:03Z","title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T17:09:48.354209Z"},"links":{"citing_paper":"/paper/2501.13964"},"observation_digest":"sha256:fff816b87767ea7231a70fab56bd6bea3b85379a9e56fa9643c93fd4fc09ecc4","observation_id":"6ce20968-349b-4398-ac92-78450cf7b04e","resolution":{"observed_at":"2026-08-10T17:09:48.949926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:09:48.928610Z","title":null,"venue":null,"work_id":"74028f0c-fc2f-4d3a-ab88-cc862cbaf533","year":2022},"citing_paper":{"arxiv_id":"2501.13964","last_updated":"2025-02-01T20:27:00Z","snapshot_observed_at":"2026-08-12T15:01:12.682271Z","submitted_at":"2025-01-21T23:07:03Z","title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T17:09:48.360794Z"},"links":{"citing_paper":"/paper/2501.13964"},"observation_digest":"sha256:82702d3cb999dd53cebbaaf7dcd2d17a85c00ac8a362d97fecbc066ced77dc06","observation_id":"e545ea6c-8c0c-4533-b85b-2d1b61d5941d","resolution":{"observed_at":"2026-08-10T17:09:48.933564Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:09:48.912413Z","title":"Hore and D","venue":null,"work_id":"63d41f17-7f44-41a9-9e2a-6a2bf65b6d1b","year":2010},"citing_paper":{"arxiv_id":"2501.13964","last_updated":"2025-02-01T20:27:00Z","snapshot_observed_at":"2026-08-12T15:01:12.682271Z","submitted_at":"2025-01-21T23:07:03Z","title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T17:09:48.367757Z"},"links":{"citing_paper":"/paper/2501.13964"},"observation_digest":"sha256:bd7cf80df9b32083b185380da77fbe6500b8f6bd5741fb1985c6de0fcd0539bd","observation_id":"216774a1-63c3-40f6-a22c-553cfe270964","resolution":{"observed_at":"2026-08-10T17:09:48.917510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:09:48.896897Z","title":null,"venue":null,"work_id":"9e18d749-31e0-42de-b173-91a9910a81e7","year":2024},"citing_paper":{"arxiv_id":"2501.13964","last_updated":"2025-02-01T20:27:00Z","snapshot_observed_at":"2026-08-12T15:01:12.682271Z","submitted_at":"2025-01-21T23:07:03Z","title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T17:09:48.373793Z"},"links":{"citing_paper":"/paper/2501.13964"},"observation_digest":"sha256:999ee02b17a79bedbcfdffde5bd52568f609a9a6eda1bec0a29c9fa84e4afabb","observation_id":"e19a9ae2-0c26-4474-a797-493a1514c884","resolution":{"observed_at":"2026-08-10T17:09:48.901400Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:09:48.881721Z","title":"Langlotz, T","venue":null,"work_id":"0d576fff-2a74-4df0-8b86-eb9b6d7c0509","year":2014},"citing_paper":{"arxiv_id":"2501.13964","last_updated":"2025-02-01T20:27:00Z","snapshot_observed_at":"2026-08-12T15:01:12.682271Z","submitted_at":"2025-01-21T23:07:03Z","title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T17:09:48.380146Z"},"links":{"citing_paper":"/paper/2501.13964"},"observation_digest":"sha256:0570aa641d70d073a495663b9196766a92d122d72a6fbe0dc9dc4c236d37d07c","observation_id":"f1d7a737-8ec1-4728-b7dc-d2077da8efda","resolution":{"observed_at":"2026-08-10T17:09:48.886693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:09:48.865849Z","title":"Lin and G","venue":null,"work_id":"9546be52-16cb-4c1a-b030-786379205d5a","year":2018},"citing_paper":{"arxiv_id":"2501.13964","last_updated":"2025-02-01T20:27:00Z","snapshot_observed_at":"2026-08-12T15:01:12.682271Z","submitted_at":"2025-01-21T23:07:03Z","title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T17:09:48.386300Z"},"links":{"citing_paper":"/paper/2501.13964"},"observation_digest":"sha256:c7ab5203b448003429c75c9b3a8ae09ec5f6a5b064f262051f22317ad3157af8","observation_id":"b14c3b4f-d6e3-4940-9894-146bfd19dfb9","resolution":{"observed_at":"2026-08-10T17:09:48.871113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10719","last_updated":"2024-12-16T00:37:54Z","snapshot_observed_at":"2026-08-16T13:18:01.861483Z","submitted_at":"2024-09-16T20:47:00Z","title":"Benchmarking VLMs' Reasoning About Persuasive Atypical Images","version":3},"cited_work":{"arxiv_id":"2409.10719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.10719","snapshot_observed_at":"2026-08-10T17:09:48.594110Z","title":"Benchmarking VLMs' Reasoning About Persuasive Atypical Images","venue":"cs.CV","work_id":"217a2b27-1580-4411-a8d1-a6400b604bdf","year":2024},"citing_paper":{"arxiv_id":"2501.13964","last_updated":"2025-02-01T20:27:00Z","snapshot_observed_at":"2026-08-12T15:01:12.682271Z","submitted_at":"2025-01-21T23:07:03Z","title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T17:09:48.391280Z"},"links":{"cited_paper":"/paper/2409.10719","citing_paper":"/paper/2501.13964"},"observation_digest":"sha256:dd840265e130b82b8910f0cf593bd29f66d2f54d998167f70512c44cab4739c6","observation_id":"6824137e-d066-4920-bdc4-fb628ad5dbce","resolution":{"observed_at":"2026-08-10T17:09:48.605900Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:09:48.846318Z","title":"Merino, M","venue":null,"work_id":"439a53d0-fbc2-403f-b111-449dc9a1cae5","year":2009},"citing_paper":{"arxiv_id":"2501.13964","last_updated":"2025-02-01T20:27:00Z","snapshot_observed_at":"2026-08-12T15:01:12.682271Z","submitted_at":"2025-01-21T23:07:03Z","title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T17:09:48.399229Z"},"links":{"citing_paper":"/paper/2501.13964"},"observation_digest":"sha256:cb8873b7554c3008d60a4d115f85430dc2d94e9318270fd0b1fc56aef7c91b42","observation_id":"b75f2670-a0ef-4fcf-96f6-8540535099e0","resolution":{"observed_at":"2026-08-10T17:09:48.853280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:09:48.829104Z","title":"Scaniverse - 3D scanner","venue":null,"work_id":"bc7484f6-d8bc-484f-ae51-1db6c221238f","year":null},"citing_paper":{"arxiv_id":"2501.13964","last_updated":"2025-02-01T20:27:00Z","snapshot_observed_at":"2026-08-12T15:01:12.682271Z","submitted_at":"2025-01-21T23:07:03Z","title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T17:09:48.405624Z"},"links":{"citing_paper":"/paper/2501.13964"},"observation_digest":"sha256:6fe4b5ec970b1088d5b6bc71fa00b00219e7d23627ede750c974f137f9e9604b","observation_id":"90f8b250-aa44-4eaf-a0f4-e9c787e3f638","resolution":{"observed_at":"2026-08-10T17:09:48.834386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-10T17:09:48.411289Z","title":"GPT-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13964","last_updated":"2025-02-01T20:27:00Z","snapshot_observed_at":"2026-08-12T15:01:12.682271Z","submitted_at":"2025-01-21T23:07:03Z","title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T17:09:48.411289Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2501.13964"},"observation_digest":"sha256:ae3037829ecdf158748888ef3b0c17d222bc038193882e1adf162b186997f994","observation_id":"7df0c80f-d97a-42aa-aafb-6a74e51137b3","resolution":{"observed_at":"2026-08-10T17:09:48.411289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:09:48.811675Z","title":null,"venue":null,"work_id":"5d50b6d2-ef49-4eff-881b-9699a64106eb","year":2024},"citing_paper":{"arxiv_id":"2501.13964","last_updated":"2025-02-01T20:27:00Z","snapshot_observed_at":"2026-08-12T15:01:12.682271Z","submitted_at":"2025-01-21T23:07:03Z","title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T17:09:48.416606Z"},"links":{"citing_paper":"/paper/2501.13964"},"observation_digest":"sha256:c9598c56084738d5d906c12183b08c3d6fc4b277178ce1ae7acf03c54c88b93d","observation_id":"0e55db64-d06d-405e-a545-f2ba9e6984f7","resolution":{"observed_at":"2026-08-10T17:09:48.816749Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:09:48.793608Z","title":null,"venue":null,"work_id":"16fbf2a2-584a-4229-a1a6-2f02f6dee606","year":2015},"citing_paper":{"arxiv_id":"2501.13964","last_updated":"2025-02-01T20:27:00Z","snapshot_observed_at":"2026-08-12T15:01:12.682271Z","submitted_at":"2025-01-21T23:07:03Z","title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T17:09:48.423492Z"},"links":{"citing_paper":"/paper/2501.13964"},"observation_digest":"sha256:52772890fb7d4aa1fce3d205d4b35171e1dcae6687bb430516150e8d0909f8b4","observation_id":"aab4727b-d344-4b8f-b653-d0687564adb2","resolution":{"observed_at":"2026-08-10T17:09:48.800306Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:09:48.775466Z","title":"Scargill, S","venue":null,"work_id":"c2da29bb-dfef-4cd1-a0f1-f68d5bd10f5d","year":2021},"citing_paper":{"arxiv_id":"2501.13964","last_updated":"2025-02-01T20:27:00Z","snapshot_observed_at":"2026-08-12T15:01:12.682271Z","submitted_at":"2025-01-21T23:07:03Z","title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T17:09:48.429702Z"},"links":{"citing_paper":"/paper/2501.13964"},"observation_digest":"sha256:d4a825063e4ad392aef8ddd10dea64cad25120aace8a1b638bb91914253c4d46","observation_id":"d7101241-8bbe-434a-8a3c-fe30bec96e77","resolution":{"observed_at":"2026-08-10T17:09:48.780959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:09:48.754261Z","title":null,"venue":null,"work_id":"c5740470-fa59-461d-aa18-de9ff157dc79","year":2024},"citing_paper":{"arxiv_id":"2501.13964","last_updated":"2025-02-01T20:27:00Z","snapshot_observed_at":"2026-08-12T15:01:12.682271Z","submitted_at":"2025-01-21T23:07:03Z","title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T17:09:48.434251Z"},"links":{"citing_paper":"/paper/2501.13964"},"observation_digest":"sha256:83422fd312e23d616d038af6a833aeb06a0422230c7d7c16a9201bce037c9a79","observation_id":"0faaf8fa-95cf-4e38-bb40-abd9c9300118","resolution":{"observed_at":"2026-08-10T17:09:48.761752Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:09:48.732745Z","title":null,"venue":null,"work_id":"09a9734f-b2f4-4df7-828f-460000417d1d","year":2023},"citing_paper":{"arxiv_id":"2501.13964","last_updated":"2025-02-01T20:27:00Z","snapshot_observed_at":"2026-08-12T15:01:12.682271Z","submitted_at":"2025-01-21T23:07:03Z","title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T17:09:48.439765Z"},"links":{"citing_paper":"/paper/2501.13964"},"observation_digest":"sha256:84d1652dc0410530aaf9c0d3d0aa74ca73e17849635d24de5f8adc84d3b11926","observation_id":"83519a63-059b-4b5f-bfa4-f1a9399b445e","resolution":{"observed_at":"2026-08-10T17:09:48.737090Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:09:48.710521Z","title":"Wasenm¨uller, M","venue":null,"work_id":"cd36bb56-3343-4197-a4d2-014899b0ecd2","year":2016},"citing_paper":{"arxiv_id":"2501.13964","last_updated":"2025-02-01T20:27:00Z","snapshot_observed_at":"2026-08-12T15:01:12.682271Z","submitted_at":"2025-01-21T23:07:03Z","title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T17:09:48.446260Z"},"links":{"citing_paper":"/paper/2501.13964"},"observation_digest":"sha256:05cf8af2ef9c9dc002dcfad4ec1171b2f9b893d9de0917287e365d6321fb6fef","observation_id":"64432e7a-7bbc-423c-b409-42cd7e0247e6","resolution":{"observed_at":"2026-08-10T17:09:48.716731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:09:48.687685Z","title":null,"venue":null,"work_id":"d7933a1c-b9d8-4185-9454-1297b77c1fad","year":2025},"citing_paper":{"arxiv_id":"2501.13964","last_updated":"2025-02-01T20:27:00Z","snapshot_observed_at":"2026-08-12T15:01:12.682271Z","submitted_at":"2025-01-21T23:07:03Z","title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T17:09:48.451543Z"},"links":{"citing_paper":"/paper/2501.13964"},"observation_digest":"sha256:4b3ec357a90cb85da0a2ea200a1bc2b655c522279d4e014caaa6eee604c8555d","observation_id":"ef7108f6-6ed3-4630-9745-08e0ad1a87fe","resolution":{"observed_at":"2026-08-10T17:09:48.693970Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:09:48.668826Z","title":"Zhang, J","venue":null,"work_id":"5e46ed21-1b3a-443c-9f9c-daae59c5c9b2","year":2024},"citing_paper":{"arxiv_id":"2501.13964","last_updated":"2025-02-01T20:27:00Z","snapshot_observed_at":"2026-08-12T15:01:12.682271Z","submitted_at":"2025-01-21T23:07:03Z","title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T17:09:48.457458Z"},"links":{"citing_paper":"/paper/2501.13964"},"observation_digest":"sha256:7b337af8b8e555685d2c88cad8d8df8f270957fe57eeb9bf4e4691a69395fdc3","observation_id":"0079f7c2-cd58-48fc-ba6b-e3c337c1efa4","resolution":{"observed_at":"2026-08-10T17:09:48.674479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19301","last_updated":"2023-10-30T06:35:37Z","snapshot_observed_at":"2026-08-17T15:43:41.171640Z","submitted_at":"2023-10-30T06:35:37Z","title":"ROME: Evaluating Pre-trained Vision-Language Models on Reasoning beyond Visual Common Sense","version":1},"cited_work":{"arxiv_id":"2310.19301","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.19301","snapshot_observed_at":"2026-08-10T17:09:48.529103Z","title":"ROME: Evaluating Pre-trained Vision-Language Models on Reasoning beyond Visual Common Sense","venue":"cs.CL","work_id":"ed51f253-7d14-41bf-8634-cb2fd70098d8","year":2023},"citing_paper":{"arxiv_id":"2501.13964","last_updated":"2025-02-01T20:27:00Z","snapshot_observed_at":"2026-08-12T15:01:12.682271Z","submitted_at":"2025-01-21T23:07:03Z","title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T17:09:48.465115Z"},"links":{"cited_paper":"/paper/2310.19301","citing_paper":"/paper/2501.13964"},"observation_digest":"sha256:ec75907b913e8bd7b1cb4504b67249541af62375565b30460e59fc0f9cb885ba","observation_id":"654e44fd-1398-4e1b-ac84-d7cc2cf08f6c","resolution":{"observed_at":"2026-08-10T17:09:48.538210Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.13964","last_updated":"2025-02-01T20:27:00Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T15:01:12.682271Z","submitted_at":"2025-01-21T23:07:03Z","title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":2,"verified_fuzzy":12},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 0 inbound Pith citation observations for arXiv:2501.13964."}