{"as_of":"2026-08-22T16:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5ce1137c473f0cbd607ff3d4edc749203d00a0b225d979da353d95cbb575a977","coverage":[{"denominator":18,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T09:31:56.230128Z","state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T22:00:28.350003Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-02T17:27:15.695591Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.14904","last_updated":"2026-06-01T09:12:30Z","snapshot_observed_at":"2026-08-16T08:28:22.595515Z","submitted_at":"2025-10-16T17:20:22Z","title":"CaptionFormer: Unified Segmentation, Tracking, and Captioning for Spatio-Temporal Objects","version":4},"cited_work":{"arxiv_id":"2510.14904","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.14904","snapshot_observed_at":"2026-07-02T17:27:15.695591Z","title":"CaptionFormer: Unified Segmentation, Tracking, and Captioning for Spatio-Temporal Objects","venue":"cs.CV","work_id":"fe7c3bed-bb44-4051-a0b8-981d859088be","year":2025},"citing_paper":{"arxiv_id":"2606.07433","last_updated":"2026-06-05T16:29:13Z","snapshot_observed_at":"2026-08-01T21:05:06.439607Z","submitted_at":"2026-06-05T16:29:13Z","title":"Watch, Remember, Reason: Human-View Video Understanding with MLLMs","version":1},"reference_index":119,"source":"pdf_text","source_observed_at":"2026-06-27T22:00:28.350003Z"},"links":{"cited_paper":"/paper/2510.14904","citing_paper":"/paper/2606.07433"},"observation_digest":"sha256:0f6aaf9c0b640b2cdc347bc93f681d5ee204a8cb1fd0d6b401545787d14394a9","observation_id":"f69ea9cf-2ddc-4df9-b101-ba497e1521bf","resolution":{"observed_at":"2026-07-02T17:27:15.697142Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2510.14904/citation-record","integrity":"/paper/2510.14904/integrity","json":"/paper/2510.14904/citation-record.json","paper":"/paper/2510.14904"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-17T03:25:04.404839Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-04T09:31:54.671015Z","title":"Phi-3 technical report: A highly capable language model locally on your phone.arXiv preprint arXiv:2404.14219,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.14904","last_updated":"2026-06-01T09:12:30Z","snapshot_observed_at":"2026-08-16T08:28:22.595515Z","submitted_at":"2025-10-16T17:20:22Z","title":"CaptionFormer: Unified Segmentation, Tracking, and Captioning for Spatio-Temporal Objects","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T09:31:54.671015Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2510.14904"},"observation_digest":"sha256:6cb89f470a714e6c70094bf55f2db5c18f0797c98f0e5b03120d68a192a56aca","observation_id":"b9d496f5-0135-4d66-9a52-e266713f2900","resolution":{"observed_at":"2026-08-04T09:31:54.671015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-20T15:31:01.041088Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-04T09:31:54.979216Z","title":"Qwen technical report.arXiv preprint arXiv:2309.16609,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.14904","last_updated":"2026-06-01T09:12:30Z","snapshot_observed_at":"2026-08-16T08:28:22.595515Z","submitted_at":"2025-10-16T17:20:22Z","title":"CaptionFormer: Unified Segmentation, Tracking, and Captioning for Spatio-Temporal Objects","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T09:31:54.979216Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2510.14904"},"observation_digest":"sha256:4c362964ccd0f177d4db34a78ca8b1f666e469b9e4e0f1e5d35e968dc2adf694","observation_id":"f5cb5944-ad01-445f-9ada-49d3245f2506","resolution":{"observed_at":"2026-08-04T09:31:54.979216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-20T14:30:51.079652Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-04T09:31:55.130506Z","title":"Microsoft COCO Captions: Data collection and evaluation server.arXiv preprint arXiv:1504.00325,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.14904","last_updated":"2026-06-01T09:12:30Z","snapshot_observed_at":"2026-08-16T08:28:22.595515Z","submitted_at":"2025-10-16T17:20:22Z","title":"CaptionFormer: Unified Segmentation, Tracking, and Captioning for Spatio-Temporal Objects","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T09:31:55.130506Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2510.14904"},"observation_digest":"sha256:f60fb8195121c6103be35b9998ca97898eebbe3d70d69ef5bd4d96cd7caeb2ba","observation_id":"c1f49450-7e1b-424f-b3e3-caf108aba6aa","resolution":{"observed_at":"2026-08-04T09:31:55.130506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10764","last_updated":"2021-12-20T18:59:59Z","snapshot_observed_at":"2026-08-18T18:30:41.010430Z","submitted_at":"2021-12-20T18:59:59Z","title":"Mask2Former for Video Instance Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10764","snapshot_observed_at":"2026-08-04T09:31:55.211242Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.14904","last_updated":"2026-06-01T09:12:30Z","snapshot_observed_at":"2026-08-16T08:28:22.595515Z","submitted_at":"2025-10-16T17:20:22Z","title":"CaptionFormer: Unified Segmentation, Tracking, and Captioning for Spatio-Temporal Objects","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T09:31:55.211242Z"},"links":{"cited_paper":"/paper/2112.10764","citing_paper":"/paper/2510.14904"},"observation_digest":"sha256:8a5661c8c8cbfec3bd6e6eee084f6a8e1c5e72939e49fd45a876dac592d3cd8d","observation_id":"10c61aa5-734c-4aec-b0a5-643ae63bd371","resolution":{"observed_at":"2026-08-04T09:31:55.211242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1603.00831","last_updated":"2016-05-03T23:55:38Z","snapshot_observed_at":"2026-08-14T22:07:48.478216Z","submitted_at":"2016-03-02T19:07:56Z","title":"MOT16: A Benchmark for Multi-Object Tracking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1603.00831","snapshot_observed_at":"2026-08-04T09:31:55.405737Z","title":"MOT16: A benchmark for multi-object tracking.arXiv preprint arXiv:1603.00831,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.14904","last_updated":"2026-06-01T09:12:30Z","snapshot_observed_at":"2026-08-16T08:28:22.595515Z","submitted_at":"2025-10-16T17:20:22Z","title":"CaptionFormer: Unified Segmentation, Tracking, and Captioning for Spatio-Temporal Objects","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T09:31:55.405737Z"},"links":{"cited_paper":"/paper/1603.00831","citing_paper":"/paper/2510.14904"},"observation_digest":"sha256:23d04b5a34bb5e5c6f4e029e4fe81271ec181035ec76fcdd1fa1988c7400cea9","observation_id":"f0f2e32d-d78b-47c8-962d-16790570e484","resolution":{"observed_at":"2026-08-04T09:31:55.405737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-04T09:31:55.677230Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.arXiv preprint arXiv:2403.05530,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.14904","last_updated":"2026-06-01T09:12:30Z","snapshot_observed_at":"2026-08-16T08:28:22.595515Z","submitted_at":"2025-10-16T17:20:22Z","title":"CaptionFormer: Unified Segmentation, Tracking, and Captioning for Spatio-Temporal Objects","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T09:31:55.677230Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2510.14904"},"observation_digest":"sha256:55687abc9ca1c38ab50584b568b5b96b188961eb73bc9192f84b38bbec97eb18","observation_id":"a7f2d587-583a-4d8d-ab65-175b7edd4ba3","resolution":{"observed_at":"2026-08-04T09:31:55.677230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-04T09:31:55.764860Z","title":"OPT: Open Pre-trained Transformer language models.arXiv preprint arXiv:2205.01068, 2022a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.14904","last_updated":"2026-06-01T09:12:30Z","snapshot_observed_at":"2026-08-16T08:28:22.595515Z","submitted_at":"2025-10-16T17:20:22Z","title":"CaptionFormer: Unified Segmentation, Tracking, and Captioning for Spatio-Temporal Objects","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T09:31:55.764860Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2510.14904"},"observation_digest":"sha256:0261e0a47c2eaea82d108dd8a762da9f1ed8da64ef3b5da6236d70307ac6ebde","observation_id":"c086e104-ba0c-4d83-871c-b98f3eecf8f9","resolution":{"observed_at":"2026-08-04T09:31:55.764860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.07850","last_updated":"2019-04-25T16:20:02Z","snapshot_observed_at":"2026-08-22T02:24:48.053046Z","submitted_at":"2019-04-16T17:54:26Z","title":"Objects as Points","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.07850","snapshot_observed_at":"2026-08-04T09:31:55.854600Z","title":"Objects as points.arXiv preprint arXiv:1904.07850,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2510.14904","last_updated":"2026-06-01T09:12:30Z","snapshot_observed_at":"2026-08-16T08:28:22.595515Z","submitted_at":"2025-10-16T17:20:22Z","title":"CaptionFormer: Unified Segmentation, Tracking, and Captioning for Spatio-Temporal Objects","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T09:31:55.854600Z"},"links":{"cited_paper":"/paper/1904.07850","citing_paper":"/paper/2510.14904"},"observation_digest":"sha256:fdbe7a30837eb508dac2c737a31a3f3327bfe0b13074943db1ec1235d3ed3c2d","observation_id":"1b28ff36-1485-409a-977a-e2fd82a4212d","resolution":{"observed_at":"2026-08-04T09:31:55.854600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:31:55.968091Z","title":"We attribute this difference to the numerous objects that disappear for a significant number of frames in the long videos of VidSTG","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.14904","last_updated":"2026-06-01T09:12:30Z","snapshot_observed_at":"2026-08-16T08:28:22.595515Z","submitted_at":"2025-10-16T17:20:22Z","title":"CaptionFormer: Unified Segmentation, Tracking, and Captioning for Spatio-Temporal Objects","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T09:31:55.968091Z"},"links":{"citing_paper":"/paper/2510.14904"},"observation_digest":"sha256:b9b8ce231c82a895222a1d7c920e2b734f70979cec4e7a934747e0dc9007bfa0","observation_id":"df0af9d0-9f62-4bb3-a8cb-6124ff427a92","resolution":{"observed_at":"2026-08-04T09:31:55.968091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:31:56.055146Z","title":"pair of tongs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14904","last_updated":"2026-06-01T09:12:30Z","snapshot_observed_at":"2026-08-16T08:28:22.595515Z","submitted_at":"2025-10-16T17:20:22Z","title":"CaptionFormer: Unified Segmentation, Tracking, and Captioning for Spatio-Temporal Objects","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T09:31:56.055146Z"},"links":{"citing_paper":"/paper/2510.14904"},"observation_digest":"sha256:174111346544c0d587e08264686bb87d2cba6fddd21867ba1d7a1d2831f18e8f","observation_id":"f73a68d5-7146-42a6-9c2a-747a8c1d5d89","resolution":{"observed_at":"2026-08-04T09:31:56.055146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:31:56.125904Z","title":"bottle\":","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14904","last_updated":"2026-06-01T09:12:30Z","snapshot_observed_at":"2026-08-16T08:28:22.595515Z","submitted_at":"2025-10-16T17:20:22Z","title":"CaptionFormer: Unified Segmentation, Tracking, and Captioning for Spatio-Temporal Objects","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T09:31:56.125904Z"},"links":{"citing_paper":"/paper/2510.14904"},"observation_digest":"sha256:58d060a5ae3e13cf95a0c7eeb50d4d12529989b4f31bdb3c735ef070421343a4","observation_id":"e257921a-b5e1-4351-805f-d89416021cfc","resolution":{"observed_at":"2026-08-04T09:31:56.125904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:31:56.230128Z","title":"For VidSTG/VLN/BenSMOT experiments we use video-level tuning for captioning with temporal aggregation, with Tagg = 32/8/8 respectively","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14904","last_updated":"2026-06-01T09:12:30Z","snapshot_observed_at":"2026-08-16T08:28:22.595515Z","submitted_at":"2025-10-16T17:20:22Z","title":"CaptionFormer: Unified Segmentation, Tracking, and Captioning for Spatio-Temporal Objects","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T09:31:56.230128Z"},"links":{"citing_paper":"/paper/2510.14904"},"observation_digest":"sha256:1b21c68a5ddcb122bb2aaa0eca729b3c097d982cddffcd868bb25bff6510be5d","observation_id":"c70f8275-a183-47bf-ae31-e5005b7c144c","resolution":{"observed_at":"2026-08-04T09:31:56.230128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01329","last_updated":"2023-02-02T18:58:58Z","snapshot_observed_at":"2026-08-16T15:58:06.886842Z","submitted_at":"2023-02-02T18:58:58Z","title":"Dreamix: Video Diffusion Models are General Video Editors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.01329","snapshot_observed_at":"2026-08-04T09:31:55.488204Z","title":"Dreamix: Video diffusion models are general video editors.arXiv preprint arXiv:2302.01329,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.14904","last_updated":"2026-06-01T09:12:30Z","snapshot_observed_at":"2026-08-16T08:28:22.595515Z","submitted_at":"2025-10-16T17:20:22Z","title":"CaptionFormer: Unified Segmentation, Tracking, and Captioning for Spatio-Temporal Objects","version":4},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-04T09:31:55.488204Z"},"links":{"cited_paper":"/paper/2302.01329","citing_paper":"/paper/2510.14904"},"observation_digest":"sha256:9a45f03de06cee0b37831d74bb0c839e6af353aba5efb46d12f4fc900411f63e","observation_id":"02b19bb7-47ed-45df-af26-832d62963239","resolution":{"observed_at":"2026-08-04T09:31:55.488204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-08-20T18:27:04.837880Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-04T09:31:55.556728Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.14904","last_updated":"2026-06-01T09:12:30Z","snapshot_observed_at":"2026-08-16T08:28:22.595515Z","submitted_at":"2025-10-16T17:20:22Z","title":"CaptionFormer: Unified Segmentation, Tracking, and Captioning for Spatio-Temporal Objects","version":4},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-04T09:31:55.556728Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2510.14904"},"observation_digest":"sha256:6ae3ce729d70900373bcb2acfa22d2be082a31cdbc0f722560059ec3f3cca093","observation_id":"c31615e6-fe7c-4042-9204-7fcb77738f34","resolution":{"observed_at":"2026-08-04T09:31:55.556728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-08-13T14:42:26.982679Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-04T09:31:55.057137Z","title":"Shikra: Unleashing multimodal LLM’s referential dialogue magic.arXiv preprint arXiv:2306.15195,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.14904","last_updated":"2026-06-01T09:12:30Z","snapshot_observed_at":"2026-08-16T08:28:22.595515Z","submitted_at":"2025-10-16T17:20:22Z","title":"CaptionFormer: Unified Segmentation, Tracking, and Captioning for Spatio-Temporal Objects","version":4},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-04T09:31:55.057137Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2510.14904"},"observation_digest":"sha256:eb119dc8462b98213dcd2147087193bbdf8d0256f8ca65fabd49f57b4b269f8d","observation_id":"484453aa-2b37-403e-91e9-67c6d07ab0b1","resolution":{"observed_at":"2026-08-04T09:31:55.057137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-08-18T11:44:22.813405Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-04T09:31:54.874954Z","title":"Do as I can, not as I say: Grounding language in robotic affordances.arXiv preprint arXiv:2204.01691,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.14904","last_updated":"2026-06-01T09:12:30Z","snapshot_observed_at":"2026-08-16T08:28:22.595515Z","submitted_at":"2025-10-16T17:20:22Z","title":"CaptionFormer: Unified Segmentation, Tracking, and Captioning for Spatio-Temporal Objects","version":4},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T09:31:54.874954Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2510.14904"},"observation_digest":"sha256:0a17dc359e61ed9609da62abdda59b1d2b414a4c0a27961ac4649625b36a828f","observation_id":"46532c84-7337-422b-933d-91342ba3ec0f","resolution":{"observed_at":"2026-08-04T09:31:54.874954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-04T09:31:54.797674Z","title":"GPT-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.14904","last_updated":"2026-06-01T09:12:30Z","snapshot_observed_at":"2026-08-16T08:28:22.595515Z","submitted_at":"2025-10-16T17:20:22Z","title":"CaptionFormer: Unified Segmentation, Tracking, and Captioning for Spatio-Temporal Objects","version":4},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T09:31:54.797674Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2510.14904"},"observation_digest":"sha256:8307b09275912881b8b278da3d18871470f458b35e7b15baf5c59af5b22fe4b3","observation_id":"cc5e43c7-6ca4-42bb-9704-686e15bb2390","resolution":{"observed_at":"2026-08-04T09:31:54.797674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-04T09:31:55.311502Z","title":"The Llama 3 herd of models.arXiv preprint arXiv:2407.21783,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.14904","last_updated":"2026-06-01T09:12:30Z","snapshot_observed_at":"2026-08-16T08:28:22.595515Z","submitted_at":"2025-10-16T17:20:22Z","title":"CaptionFormer: Unified Segmentation, Tracking, and Captioning for Spatio-Temporal Objects","version":4},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T09:31:55.311502Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2510.14904"},"observation_digest":"sha256:8f254941873cb0090c3b60203c81970e29aafd126533c42247098eba3413d582","observation_id":"50f1efc0-2eac-420c-bf07-6137a9194470","resolution":{"observed_at":"2026-08-04T09:31:55.311502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.14904","last_updated":"2026-06-01T09:12:30Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T08:28:22.595515Z","submitted_at":"2025-10-16T17:20:22Z","title":"CaptionFormer: Unified Segmentation, Tracking, and Captioning for Spatio-Temporal Objects"},"reference_resolution":{"displayed":18,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":18},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 18 of 18 outbound references and 1 inbound Pith citation observation for arXiv:2510.14904."}