{"as_of":"2026-08-09T18:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:30074160fb164a6de1621ceaa2f736061eee728af7c3c9d3679d6715c958ebf8","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":31,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T23:13:13.832416Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:29:57.509967Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":"2109.10852","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-07-04T16:29:57.509967Z","title":"Pix2seq: A language modeling framework for object detection","venue":null,"work_id":"c10c912e-59c0-4cd0-b849-c2274cb7a92e","year":2021},"citing_paper":{"arxiv_id":"2209.06794","last_updated":"2023-06-05T17:55:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-14T17:24:07Z","title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","version":4},"reference_index":126,"source":"arxiv_source","source_observed_at":"2026-05-16T09:29:05.956863Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2209.06794"},"observation_digest":"sha256:975b088cd79ebaccbbb11d267899c82e3696f1458583f4fffcb3d700a2cb823d","observation_id":"b2bc0035-cad0-45d2-9898-aa2b889484f4","resolution":{"observed_at":"2026-05-16T09:29:06.060099Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":"2109.10852","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-07-04T16:29:57.509967Z","title":"Pix2seq: A language modeling framework for object detection","venue":null,"work_id":"c10c912e-59c0-4cd0-b849-c2274cb7a92e","year":2021},"citing_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T05:19:47.907355Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2306.14824"},"observation_digest":"sha256:8d8e7c8f59f225d051302ebb4e0cd5894ed5872e78d492c6560fc796b430da9f","observation_id":"f64e0af2-a489-4db7-8691-5181f8745e60","resolution":{"observed_at":"2026-05-12T05:19:47.994723Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":"2109.10852","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-07-04T16:29:57.509967Z","title":"Pix2seq: A language modeling framework for object detection","venue":null,"work_id":"c10c912e-59c0-4cd0-b849-c2274cb7a92e","year":2021},"citing_paper":{"arxiv_id":"2310.01415","last_updated":"2023-12-05T05:26:29Z","snapshot_observed_at":"2026-07-06T16:26:38.284922Z","submitted_at":"2023-10-02T17:59:57Z","title":"GPT-Driver: Learning to Drive with GPT","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T15:05:31.928650Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2310.01415"},"observation_digest":"sha256:200c0e7b682e12b96e2e6fa71d74f372732cd164967983e18d1dbb2ac46b1fe4","observation_id":"8983684b-913a-40e2-a290-e8fafe5acfde","resolution":{"observed_at":"2026-05-15T15:05:32.021160Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":"2109.10852","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-07-04T16:29:57.509967Z","title":"Pix2seq: A language modeling framework for object detection","venue":null,"work_id":"c10c912e-59c0-4cd0-b849-c2274cb7a92e","year":2021},"citing_paper":{"arxiv_id":"2401.10935","last_updated":"2024-02-23T04:36:51Z","snapshot_observed_at":"2026-08-08T03:28:12.161766Z","submitted_at":"2024-01-17T08:10:35Z","title":"SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-17T10:09:46.447508Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2401.10935"},"observation_digest":"sha256:cf151d365692153f414bbfdc421ab28d8123b84bb52430704a8d995b6f549e68","observation_id":"b5e2380d-d81a-4911-813b-a6c92648deb8","resolution":{"observed_at":"2026-05-17T10:09:46.513448Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":"2109.10852","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-07-04T16:29:57.509967Z","title":"Pix2seq: A language modeling framework for object detection","venue":null,"work_id":"c10c912e-59c0-4cd0-b849-c2274cb7a92e","year":2021},"citing_paper":{"arxiv_id":"2401.14159","last_updated":"2024-01-25T13:12:09Z","snapshot_observed_at":"2026-07-06T17:20:25.138890Z","submitted_at":"2024-01-25T13:12:09Z","title":"Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-11T06:20:15.656356Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2401.14159"},"observation_digest":"sha256:30a00a909e17b0c527c8487d9c69c55def84c20b765a86a6f79836f2ab055835","observation_id":"dd8a690e-70a4-437f-85bd-de50ae779a77","resolution":{"observed_at":"2026-05-11T06:20:16.170336Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":"2109.10852","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-07-04T16:29:57.509967Z","title":"Pix2seq: A language modeling framework for object detection","venue":null,"work_id":"c10c912e-59c0-4cd0-b849-c2274cb7a92e","year":2021},"citing_paper":{"arxiv_id":"2409.12514","last_updated":"2025-05-13T11:02:20Z","snapshot_observed_at":"2026-08-07T15:12:56.367961Z","submitted_at":"2024-09-19T07:10:18Z","title":"TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation","version":5},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-17T16:12:25.980853Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2409.12514"},"observation_digest":"sha256:81d5a298e749a837d4b00a5b034a4e677d7a27a19a706effa996328cbc78b8ad","observation_id":"7b6af6b5-3c5b-452f-bc2f-01a6769cbc49","resolution":{"observed_at":"2026-05-17T16:12:26.047201Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-08-08T23:13:13.832416Z","title":"Pix2seq: A language modeling framework for object detection","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.04223","last_updated":"2025-02-06T17:07:22Z","snapshot_observed_at":"2026-08-08T23:03:36.550186Z","submitted_at":"2025-02-06T17:07:22Z","title":"\\'Eclair -- Extracting Content and Layout with Integrated Reading Order for Documents","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T23:13:13.832416Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2502.04223"},"observation_digest":"sha256:945902986dd3bccce8173b1d32b83e18c9fb7192a43456375a6984b80442cd8d","observation_id":"0c20d5ca-39b0-434b-9b4d-caca9c4e1031","resolution":{"observed_at":"2026-08-08T23:13:13.832416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-08-08T13:18:18.974768Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07277","last_updated":"2025-02-11T05:44:50Z","snapshot_observed_at":"2026-08-08T13:13:50.722462Z","submitted_at":"2025-02-11T05:44:50Z","title":"Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T13:18:18.974768Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2502.07277"},"observation_digest":"sha256:7de0a26565f43fdccc8bafe8e9b26e92f301643c85e3545b776191b96c7d95cb","observation_id":"5b769fe4-4d07-428c-a9d5-8968fd32bbb5","resolution":{"observed_at":"2026-08-08T13:18:18.974768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-08-07T23:07:35.502973Z","title":"J.; and Hinton, G","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.08974","last_updated":"2025-02-13T05:21:02Z","snapshot_observed_at":"2026-08-07T23:00:15.518281Z","submitted_at":"2025-02-13T05:21:02Z","title":"Topo2Seq: Enhanced Topology Reasoning via Topology Sequence Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T23:07:35.502973Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2502.08974"},"observation_digest":"sha256:abcf9b49910a128f280f4e7fe3e5415f4486934cf3c4bcac0db841bc58d608c5","observation_id":"b3f473d8-603e-4ab5-8bae-861db00c5167","resolution":{"observed_at":"2026-08-07T23:07:35.502973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-08-07T14:25:41.630304Z","title":"Pix2seq: A language modeling framework for object detection","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-09T06:33:06.067343Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:41.630304Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:6e95c974b5eba42066255e837fb84131432cf0bcf9de245c5c156c184ff86eac","observation_id":"7695381b-dbd6-445b-acb7-586bd352201e","resolution":{"observed_at":"2026-08-07T14:25:41.630304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-08-07T10:55:14.624177Z","title":"Pix2seq: A language modeling framework for object detection.arXiv preprint arXiv:2109.10852, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.04034","last_updated":"2025-06-04T14:56:57Z","snapshot_observed_at":"2026-08-07T10:46:30.489099Z","submitted_at":"2025-06-04T14:56:57Z","title":"Rex-Thinker: Grounded Object Referring via Chain-of-Thought Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:14.624177Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2506.04034"},"observation_digest":"sha256:f1f3651703f38267e1f09c0f62c3a4ab7b193276a33bc3f8146e44fc87150d34","observation_id":"f4ebd5fc-10b3-48ac-9858-681f8a890aab","resolution":{"observed_at":"2026-08-07T10:55:14.624177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-08-06T23:42:22.232547Z","title":"”Pix2seq: A language modeling framework for object detection.” arXiv preprint arXiv:2109.10852 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.16856","last_updated":"2025-06-20T09:14:09Z","snapshot_observed_at":"2026-08-07T09:31:28.762013Z","submitted_at":"2025-06-20T09:14:09Z","title":"ParkFormer: A Transformer-Based Parking Policy with Goal Embedding and Pedestrian-Aware Control","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:22.232547Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2506.16856"},"observation_digest":"sha256:ff9a565cfff6d2852c4ce27ff6afb63c21c02dff092898917f4eeb63b53f2fb5","observation_id":"1ed01301-9445-4456-81db-66c82418bb95","resolution":{"observed_at":"2026-08-06T23:42:22.232547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-08-06T23:13:27.661151Z","title":"Pix2seq: A language modeling framework for object detection,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.19278","last_updated":"2025-06-24T03:17:18Z","snapshot_observed_at":"2026-08-08T11:53:58.849916Z","submitted_at":"2025-06-24T03:17:18Z","title":"Style Transfer: A Decade Survey","version":1},"reference_index":259,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:27.661151Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2506.19278"},"observation_digest":"sha256:f099a501e5d44dd67b7fea9e0679a27cf46dba3d502f651a24bc6f1083e6dddd","observation_id":"e6316a38-2a01-46b3-ba27-c207979b9568","resolution":{"observed_at":"2026-08-06T23:13:27.661151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-08-06T19:43:44.541549Z","title":"Pix2seq: A language modeling framework for object detection","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04822","last_updated":"2025-07-07T09:42:37Z","snapshot_observed_at":"2026-08-09T12:24:13.699500Z","submitted_at":"2025-07-07T09:42:37Z","title":"SeqGrowGraph: Learning Lane Topology as a Chain of Graph Expansions","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:44.541549Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2507.04822"},"observation_digest":"sha256:7d21aa8fc5fc7e67b6f94b06081b5193e52c43f9f1d9e6f7974173f757245d7c","observation_id":"38abb5b1-7265-4560-99b6-0bb37bca9d5c","resolution":{"observed_at":"2026-08-06T19:43:44.541549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-08-06T19:40:15.056216Z","title":"arXiv preprint arXiv:2109.10852 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04978","last_updated":"2025-07-07T13:22:35Z","snapshot_observed_at":"2026-08-09T18:20:37.440777Z","submitted_at":"2025-07-07T13:22:35Z","title":"Parameterized Diffusion Optimization enabled Autoregressive Ordinal Regression for Diabetic Retinopathy Grading","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:40:15.056216Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2507.04978"},"observation_digest":"sha256:2ec7ca701b9279bdeabd034fbec96a3663fbfdb48763bee28d6108dfc3cb06f0","observation_id":"ae263cd5-40e8-4095-b55b-521668b566e7","resolution":{"observed_at":"2026-08-06T19:40:15.056216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-08-06T15:33:28.819122Z","title":"Multilingual code generation with knowledge distillation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00013","last_updated":"2025-07-21T11:33:57Z","snapshot_observed_at":"2026-08-06T15:27:46.136316Z","submitted_at":"2025-07-21T11:33:57Z","title":"From Provable Correctness to Probabilistic Generation: A Comparative Review of Program Synthesis Paradigms","version":1},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:28.819122Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2508.00013"},"observation_digest":"sha256:5e822505a94ebfef3f9c3775b3fffb25fcf812f7990c352b1505100e74123f6c","observation_id":"e938ce05-d126-40cc-b325-8a904404d84e","resolution":{"observed_at":"2026-08-06T15:33:28.819122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-08-05T13:58:05.084880Z","title":"Pix2seq: A language modeling framework for object detection","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.21824","last_updated":"2025-08-29T17:59:53Z","snapshot_observed_at":"2026-08-05T13:58:03.024516Z","submitted_at":"2025-08-29T17:59:53Z","title":"DriveQA: Passing the Driving Knowledge Test","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T13:58:05.084880Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2508.21824"},"observation_digest":"sha256:837b039874454d8d34b6baeff6e53cd80f4ec3ba4c76e514f72fe74bb664028d","observation_id":"6e42424b-8660-4faa-8e99-a0a2f5d10226","resolution":{"observed_at":"2026-08-05T13:58:05.084880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":"2109.10852","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-07-04T16:29:57.509967Z","title":"Pix2seq: A language modeling framework for object detection","venue":null,"work_id":"c10c912e-59c0-4cd0-b849-c2274cb7a92e","year":2021},"citing_paper":{"arxiv_id":"2510.18822","last_updated":"2026-05-18T02:07:26Z","snapshot_observed_at":"2026-08-03T04:29:55.338053Z","submitted_at":"2025-10-21T17:20:15Z","title":"SAM 2++: Tracking Anything at Any Granularity","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T19:51:56.047515Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2510.18822"},"observation_digest":"sha256:d0e9afabf4561c4e3a5e20920374fcd423dc3d3bdc77903ef85d1901abc62d5d","observation_id":"ba5068a3-5aaf-420b-90f0-38c5ea1dae20","resolution":{"observed_at":"2026-05-21T19:54:20.148463Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":"2109.10852","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-07-04T16:29:57.509967Z","title":"Pix2seq: A language modeling framework for object detection","venue":null,"work_id":"c10c912e-59c0-4cd0-b849-c2274cb7a92e","year":2021},"citing_paper":{"arxiv_id":"2602.09016","last_updated":"2026-05-11T03:15:33Z","snapshot_observed_at":"2026-07-06T22:45:11.110274Z","submitted_at":"2026-02-09T18:58:46Z","title":"Raster2Seq: Polygon Sequence Generation for Floorplan Reconstruction","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T05:19:11.066723Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2602.09016"},"observation_digest":"sha256:191cbeff85ef244052f1753a921a14b8795aa79234f6ef9f5019667fe57c274e","observation_id":"15121c37-d0da-49a1-beba-ad9b4eb35cab","resolution":{"observed_at":"2026-05-16T05:20:39.247034Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":"2109.10852","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-07-04T16:29:57.509967Z","title":"Pix2seq: A language modeling framework for object detection","venue":null,"work_id":"c10c912e-59c0-4cd0-b849-c2274cb7a92e","year":2021},"citing_paper":{"arxiv_id":"2604.02593","last_updated":"2026-04-03T00:09:14Z","snapshot_observed_at":"2026-08-05T18:03:52.271482Z","submitted_at":"2026-04-03T00:09:14Z","title":"Moondream Segmentation: From Words to Masks","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T20:14:45.629804Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2604.02593"},"observation_digest":"sha256:254dadda84509f8453ae4d8e4f69857ef9382a20960efa7bfe8ebc5fe6951d76","observation_id":"b24b4937-78e6-4a7f-b973-f6ea9009dc61","resolution":{"observed_at":"2026-05-13T20:18:13.726512Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":"2109.10852","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-07-04T16:29:57.509967Z","title":"Pix2seq: A language modeling framework for object detection","venue":null,"work_id":"c10c912e-59c0-4cd0-b849-c2274cb7a92e","year":2021},"citing_paper":{"arxiv_id":"2604.08921","last_updated":"2026-04-10T03:33:51Z","snapshot_observed_at":"2026-07-06T22:57:55.179136Z","submitted_at":"2026-04-10T03:33:51Z","title":"TAIHRI: Task-Aware 3D Human Keypoints Localization for Close-Range Human-Robot Interaction","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T17:37:44.436873Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2604.08921"},"observation_digest":"sha256:2e500f3327ff4ee450690eeb39a77b459a517c2622b7165a4ef981ec665fe480","observation_id":"d457d7e0-47e5-4d30-917a-fbac837d9dfd","resolution":{"observed_at":"2026-05-11T06:30:58.362347Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":"2109.10852","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-07-04T16:29:57.509967Z","title":"Pix2seq: A language modeling framework for object detection","venue":null,"work_id":"c10c912e-59c0-4cd0-b849-c2274cb7a92e","year":2021},"citing_paper":{"arxiv_id":"2605.14923","last_updated":"2026-05-14T14:58:46Z","snapshot_observed_at":"2026-07-06T23:26:18.733776Z","submitted_at":"2026-05-14T14:58:46Z","title":"SceneParser: Hierarchical Scene Parsing for Visual Semantics Understanding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-30T20:51:56.131205Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2605.14923"},"observation_digest":"sha256:eac8484fce205bee7a9b82ef447836e1133d3607624364ec7afdc94127403e8f","observation_id":"8caedca2-b4bf-4222-b853-4cf29b8abe56","resolution":{"observed_at":"2026-06-30T20:55:04.158931Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":"2109.10852","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-07-04T16:29:57.509967Z","title":"Pix2seq: A language modeling framework for object detection","venue":null,"work_id":"c10c912e-59c0-4cd0-b849-c2274cb7a92e","year":2021},"citing_paper":{"arxiv_id":"2605.25427","last_updated":"2026-05-25T04:58:23Z","snapshot_observed_at":"2026-07-06T23:35:21.734804Z","submitted_at":"2026-05-25T04:58:23Z","title":"Binding Visual Features Point by Point","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T22:56:44.793896Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2605.25427"},"observation_digest":"sha256:f67a46fff3f24ae9f060e7d131cd52bbb2c5945a8065df71d163282f69208c0e","observation_id":"0f3ea96d-766d-4ff2-b6fe-5f803b2ac123","resolution":{"observed_at":"2026-06-29T23:44:03.328300Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":"2109.10852","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-07-04T16:29:57.509967Z","title":"Pix2seq: A language modeling framework for object detection","venue":null,"work_id":"c10c912e-59c0-4cd0-b849-c2274cb7a92e","year":2021},"citing_paper":{"arxiv_id":"2605.30126","last_updated":"2026-05-28T15:57:31Z","snapshot_observed_at":"2026-08-03T03:31:55.994242Z","submitted_at":"2026-05-28T15:57:31Z","title":"PARCEL: Pool-Anchored Resampling with Conditioned Elastic Queries for Efficient Vision-Language Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-29T08:13:42.526597Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2605.30126"},"observation_digest":"sha256:aa8cc820abba942af2efb47a761da3e8f17d387ff7eee374871d7882d76e8921","observation_id":"69a5ac09-a4ce-4260-8892-aa5fe563d0e6","resolution":{"observed_at":"2026-06-29T08:23:15.904809Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":"2109.10852","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-07-04T16:29:57.509967Z","title":"Pix2seq: A language modeling framework for object detection","venue":null,"work_id":"c10c912e-59c0-4cd0-b849-c2274cb7a92e","year":2021},"citing_paper":{"arxiv_id":"2606.08420","last_updated":"2026-06-25T03:34:20Z","snapshot_observed_at":"2026-08-09T15:54:05.963219Z","submitted_at":"2026-06-07T02:41:05Z","title":"CheXanatomy: Anatomy-Aware Vision-Language Modeling for Chest Radiographs","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T19:01:14.023587Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2606.08420"},"observation_digest":"sha256:f93386403c1d3f7a37d7bdf85292e20b94a5cb864012d3a68b85e4a8952d71c3","observation_id":"7acf2eb3-5cee-41dc-bae7-1311d46255e9","resolution":{"observed_at":"2026-07-02T22:17:26.311197Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":"2109.10852","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-07-04T16:29:57.509967Z","title":"Pix2seq: A language modeling framework for object detection","venue":null,"work_id":"c10c912e-59c0-4cd0-b849-c2274cb7a92e","year":2021},"citing_paper":{"arxiv_id":"2606.24564","last_updated":"2026-07-02T03:45:07Z","snapshot_observed_at":"2026-08-02T15:44:18.900046Z","submitted_at":"2026-06-23T13:32:04Z","title":"PatternGSL: A Structured Specification Language for Template-Free and Simulation-Ready 3D Garments","version":2},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-06-26T00:35:32.041041Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2606.24564"},"observation_digest":"sha256:fd4a8fe7c82733cf21fb1ab4a264c25764106deaea5c40f7d541f2fe2703985e","observation_id":"1459c1ca-0239-47d2-8ea5-58544990856c","resolution":{"observed_at":"2026-07-04T16:29:57.511404Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":"2109.10852","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-07-04T16:29:57.509967Z","title":"Pix2seq: A language modeling framework for object detection","venue":null,"work_id":"c10c912e-59c0-4cd0-b849-c2274cb7a92e","year":2021},"citing_paper":{"arxiv_id":"2606.24564","last_updated":"2026-07-02T03:45:07Z","snapshot_observed_at":"2026-08-02T15:44:18.900046Z","submitted_at":"2026-06-23T13:32:04Z","title":"PatternGSL: A Structured Specification Language for Template-Free and Simulation-Ready 3D Garments","version":3},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-07-01T06:52:18.115419Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2606.24564"},"observation_digest":"sha256:bd01402dd4dfd8663d19604ea125e2171eae64149fd2ea270c5eb1345de427a1","observation_id":"ce44e7aa-d473-4b4c-950b-afbec0d58511","resolution":{"observed_at":"2026-07-01T06:55:29.063968Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":"2109.10852","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-07-04T16:29:57.509967Z","title":"Pix2seq: A language modeling framework for object detection","venue":null,"work_id":"c10c912e-59c0-4cd0-b849-c2274cb7a92e","year":2021},"citing_paper":{"arxiv_id":"2606.24564","last_updated":"2026-07-02T03:45:07Z","snapshot_observed_at":"2026-08-02T15:44:18.900046Z","submitted_at":"2026-06-23T13:32:04Z","title":"PatternGSL: A Structured Specification Language for Template-Free and Simulation-Ready 3D Garments","version":4},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-07-02T21:15:38.699918Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2606.24564"},"observation_digest":"sha256:7e8d9165ba9aecb9096227d2190d1b6f3b5c3ded35a06c3396882796ddf76808","observation_id":"679ce7b8-e97c-4fbd-999e-cd951a478da2","resolution":{"observed_at":"2026-07-02T21:17:23.693746Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":"2109.10852","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-07-04T16:29:57.509967Z","title":"Pix2seq: A language modeling framework for object detection","venue":null,"work_id":"c10c912e-59c0-4cd0-b849-c2274cb7a92e","year":2021},"citing_paper":{"arxiv_id":"2606.24564","last_updated":"2026-07-02T03:45:07Z","snapshot_observed_at":"2026-08-02T15:44:18.900046Z","submitted_at":"2026-06-23T13:32:04Z","title":"PatternGSL: A Structured Specification Language for Template-Free and Simulation-Ready 3D Garments","version":5},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-07-03T22:54:21.356538Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2606.24564"},"observation_digest":"sha256:bf66006e13e05c1e3eba4a08dedadf68bbc07dc6e07aa8ea8886cd482163c7e8","observation_id":"417e40cd-1d1d-48b8-8569-3011bd7c57b8","resolution":{"observed_at":"2026-07-03T22:59:02.648707Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":"2109.10852","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-07-04T16:29:57.509967Z","title":"Pix2seq: A language modeling framework for object detection","venue":null,"work_id":"c10c912e-59c0-4cd0-b849-c2274cb7a92e","year":2021},"citing_paper":{"arxiv_id":"2607.02083","last_updated":"2026-07-02T12:25:45Z","snapshot_observed_at":"2026-08-01T16:38:47.544758Z","submitted_at":"2026-07-02T12:25:45Z","title":"DeepGaze3.5-VL: Modeling Scanpaths via Autoregressive Token Prediction","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-03T15:49:17.217482Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2607.02083"},"observation_digest":"sha256:5d99d055876d23e777f1319e71cb2d5f353db6fcc4ba3cdac6b96232557412e3","observation_id":"694233de-d16d-4ad9-bde4-cfad591daac5","resolution":{"observed_at":"2026-07-03T15:58:37.580647Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-08-05T10:23:59.183387Z","title":"arXiv preprint arXiv:2109.10852 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03890","last_updated":"2026-08-04T16:23:39Z","snapshot_observed_at":"2026-08-09T01:26:16.078115Z","submitted_at":"2026-08-04T16:23:39Z","title":"CARE-X: Towards Clinically Useful Radiology VLMs with Auxiliary Supervision, Reward-Aligned Learning, and Tool-Augmented Measurement","version":1},"reference_index":132,"source":"arxiv_source","source_observed_at":"2026-08-05T10:23:59.183387Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2608.03890"},"observation_digest":"sha256:d3470b65f32e884865877b86a5fca658811c35a081ccf9a740ca31da9fb1738e","observation_id":"07a0372d-df47-44a6-ba5e-1cc3835d7c86","resolution":{"observed_at":"2026-08-05T10:23:59.183387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2109.10852/citation-record","integrity":"/paper/2109.10852/integrity","json":"/paper/2109.10852/citation-record.json","paper":"/paper/2109.10852"},"outbound":[],"paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 31 inbound Pith citation observations for arXiv:2109.10852."}