{"as_of":"2026-08-12T21:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ecb639999b7c4f34b47addf7880d17a454c3a069876f1c7e476c72bf11c5eee0","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":6,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":6,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:52:30.302929Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T15:09:55.009759Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.13307","last_updated":"2024-01-24T09:02:00Z","snapshot_observed_at":"2026-07-06T17:19:48.251975Z","submitted_at":"2024-01-24T09:02:00Z","title":"ChatterBox: Multi-round Multimodal Referring and Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13307","snapshot_observed_at":"2026-08-10T22:52:30.302929Z","title":"Chatter- box: Multi-round multimodal referring and grounding.arXiv preprint arXiv:2401.13307, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00599","last_updated":"2025-03-25T08:10:15Z","snapshot_observed_at":"2026-08-12T01:25:42.916146Z","submitted_at":"2024-12-31T18:56:46Z","title":"VideoRefer Suite: Advancing Spatial-Temporal Object Understanding with Video LLM","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T22:52:30.302929Z"},"links":{"cited_paper":"/paper/2401.13307","citing_paper":"/paper/2501.00599"},"observation_digest":"sha256:cadf39e350481804bcad2d7c698dd6d75b96261b5ec0f56cdbbced8367e7398c","observation_id":"b459bffb-b2d8-49b4-b2f8-581389ed9697","resolution":{"observed_at":"2026-08-10T22:52:30.302929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13307","last_updated":"2024-01-24T09:02:00Z","snapshot_observed_at":"2026-07-06T17:19:48.251975Z","submitted_at":"2024-01-24T09:02:00Z","title":"ChatterBox: Multi-round Multimodal Referring and Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13307","snapshot_observed_at":"2026-08-10T22:08:09.272318Z","title":"Chatterbox: Multi-round multimodal referring and grounding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.272318Z"},"links":{"cited_paper":"/paper/2401.13307","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:0be288f2776e0abbf71721b256b28ddf582159015c0b0cea92f61a01c729857f","observation_id":"0416a874-b557-45af-b665-202975af1755","resolution":{"observed_at":"2026-08-10T22:08:09.272318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13307","last_updated":"2024-01-24T09:02:00Z","snapshot_observed_at":"2026-07-06T17:19:48.251975Z","submitted_at":"2024-01-24T09:02:00Z","title":"ChatterBox: Multi-round Multimodal Referring and Grounding","version":1},"cited_work":{"arxiv_id":"2401.13307","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.13307","snapshot_observed_at":"2026-07-04T15:09:55.009759Z","title":"Chat- terbox: Multi-round multimodal referring and grounding","venue":null,"work_id":"a880d76a-7244-43f4-b634-271e71946f5a","year":2024},"citing_paper":{"arxiv_id":"2512.10554","last_updated":"2026-04-02T03:14:28Z","snapshot_observed_at":"2026-08-11T12:33:58.665102Z","submitted_at":"2025-12-11T11:38:50Z","title":"Grounding Everything in Tokens for Multimodal Large Language Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-16T23:31:05.422935Z"},"links":{"cited_paper":"/paper/2401.13307","citing_paper":"/paper/2512.10554"},"observation_digest":"sha256:37db6d7268fc8b9d678ff348341c75a352959011a7a05c1e61e79688841548da","observation_id":"5f725db5-be10-455e-9c8c-8492c98d1363","resolution":{"observed_at":"2026-05-16T23:31:21.891664Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13307","last_updated":"2024-01-24T09:02:00Z","snapshot_observed_at":"2026-07-06T17:19:48.251975Z","submitted_at":"2024-01-24T09:02:00Z","title":"ChatterBox: Multi-round Multimodal Referring and Grounding","version":1},"cited_work":{"arxiv_id":"2401.13307","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.13307","snapshot_observed_at":"2026-07-04T15:09:55.009759Z","title":"Chat- terbox: Multi-round multimodal referring and grounding","venue":null,"work_id":"a880d76a-7244-43f4-b634-271e71946f5a","year":2024},"citing_paper":{"arxiv_id":"2602.20913","last_updated":"2026-04-15T16:09:22Z","snapshot_observed_at":"2026-08-11T11:51:37.712014Z","submitted_at":"2026-02-24T13:49:47Z","title":"LongVideo-R1: Smart Navigation for Low-cost Long Video Understanding","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-15T20:01:31.129959Z"},"links":{"cited_paper":"/paper/2401.13307","citing_paper":"/paper/2602.20913"},"observation_digest":"sha256:f3da3d4478edc03f335cf9722aa36b2baf48b9cf15ba3a750f0ede25c1f6fa64","observation_id":"01f06659-eee1-4f52-a87b-5cf22220bed6","resolution":{"observed_at":"2026-05-15T20:01:33.380638Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13307","last_updated":"2024-01-24T09:02:00Z","snapshot_observed_at":"2026-07-06T17:19:48.251975Z","submitted_at":"2024-01-24T09:02:00Z","title":"ChatterBox: Multi-round Multimodal Referring and Grounding","version":1},"cited_work":{"arxiv_id":"2401.13307","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.13307","snapshot_observed_at":"2026-07-04T15:09:55.009759Z","title":"Chat- terbox: Multi-round multimodal referring and grounding","venue":null,"work_id":"a880d76a-7244-43f4-b634-271e71946f5a","year":2024},"citing_paper":{"arxiv_id":"2605.18018","last_updated":"2026-05-18T08:09:37Z","snapshot_observed_at":"2026-07-06T23:28:55.079333Z","submitted_at":"2026-05-18T08:09:37Z","title":"See What I Mean: Aligning Vision and Language Representations for Video Fine-grained Object Understanding","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-20T12:10:54.874012Z"},"links":{"cited_paper":"/paper/2401.13307","citing_paper":"/paper/2605.18018"},"observation_digest":"sha256:35581df18d49f2a865de3e61d20ca2f3561d3b2b0cbf0402aa3b4ed3a9ab8f36","observation_id":"665d09d2-0384-475b-81e5-6c6e3077e78b","resolution":{"observed_at":"2026-05-20T12:13:16.194382Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13307","last_updated":"2024-01-24T09:02:00Z","snapshot_observed_at":"2026-07-06T17:19:48.251975Z","submitted_at":"2024-01-24T09:02:00Z","title":"ChatterBox: Multi-round Multimodal Referring and Grounding","version":1},"cited_work":{"arxiv_id":"2401.13307","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.13307","snapshot_observed_at":"2026-07-04T15:09:55.009759Z","title":"Chat- terbox: Multi-round multimodal referring and grounding","venue":null,"work_id":"a880d76a-7244-43f4-b634-271e71946f5a","year":2024},"citing_paper":{"arxiv_id":"2606.26196","last_updated":"2026-06-24T15:20:32Z","snapshot_observed_at":"2026-07-07T00:00:31.981360Z","submitted_at":"2026-06-24T15:20:32Z","title":"From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-26T01:50:54.242508Z"},"links":{"cited_paper":"/paper/2401.13307","citing_paper":"/paper/2606.26196"},"observation_digest":"sha256:d6783318120a0533a1fd038b6d4701e8805d0da2034163e60928b7dc83d657f3","observation_id":"b6219926-56a0-4a5a-95f8-3b4ec1a0777a","resolution":{"observed_at":"2026-07-04T15:09:55.011788Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2401.13307/citation-record","integrity":"/paper/2401.13307/integrity","json":"/paper/2401.13307/citation-record.json","paper":"/paper/2401.13307"},"outbound":[],"paper":{"arxiv_id":"2401.13307","last_updated":"2024-01-24T09:02:00Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T17:19:48.251975Z","submitted_at":"2024-01-24T09:02:00Z","title":"ChatterBox: Multi-round Multimodal Referring and Grounding"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 6 inbound Pith citation observations for arXiv:2401.13307."}