{"as_of":"2026-08-09T21:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c18ea4dcea6395de0ce5bddd2f8441d2218f9ed9fec80e33c6f1e0fe7237c65b","coverage":[{"denominator":9,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T03:15:11.601779Z","state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T10:02:03.266407Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T17:40:00.898211Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.08711","last_updated":"2026-07-02T10:23:24Z","snapshot_observed_at":"2026-08-08T12:42:58.671472Z","submitted_at":"2026-02-09T14:21:58Z","title":"TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions","version":3},"cited_work":{"arxiv_id":"2602.08711","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.08711","snapshot_observed_at":"2026-07-04T17:40:00.898211Z","title":"Timechat-captioner: Scripting multi-scene videos with time-aware and structural audio-visual captions","venue":"cs.CV","work_id":"4c791cdb-a0f4-46ae-b9b5-e951f3741e21","year":2026},"citing_paper":{"arxiv_id":"2604.11102","last_updated":"2026-04-13T07:19:27Z","snapshot_observed_at":"2026-08-05T04:07:22.236608Z","submitted_at":"2026-04-13T07:19:27Z","title":"OmniScript: Towards Audio-Visual Script Generation for Long-Form Cinematic Video","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T15:35:23.842691Z"},"links":{"cited_paper":"/paper/2602.08711","citing_paper":"/paper/2604.11102"},"observation_digest":"sha256:60ba0d0a6e30428b493c55ffa7519f1734b21ab046ace23b5b8aaa362dd8bbcc","observation_id":"52056ccb-249e-40b0-a81d-75779896f93b","resolution":{"observed_at":"2026-07-03T02:17:09.422974Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.08711","last_updated":"2026-07-02T10:23:24Z","snapshot_observed_at":"2026-08-08T12:42:58.671472Z","submitted_at":"2026-02-09T14:21:58Z","title":"TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions","version":3},"cited_work":{"arxiv_id":"2602.08711","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.08711","snapshot_observed_at":"2026-07-04T17:40:00.898211Z","title":"Timechat-captioner: Scripting multi-scene videos with time-aware and structural audio-visual captions","venue":"cs.CV","work_id":"4c791cdb-a0f4-46ae-b9b5-e951f3741e21","year":2026},"citing_paper":{"arxiv_id":"2605.04503","last_updated":"2026-05-06T05:12:41Z","snapshot_observed_at":"2026-08-02T14:20:11.154625Z","submitted_at":"2026-05-06T05:12:41Z","title":"DiffCap-Bench: A Comprehensive, Challenging, Robust Benchmark for Image Difference Captioning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-08T17:56:47.621050Z"},"links":{"cited_paper":"/paper/2602.08711","citing_paper":"/paper/2605.04503"},"observation_digest":"sha256:c13d1a92aca1df37be3f05cc63fc0842842c0636ed4b0f825712f19bec09aa88","observation_id":"0a8d3301-f527-4e13-bd04-03d87c9e37d8","resolution":{"observed_at":"2026-07-03T02:17:09.422974Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.08711","last_updated":"2026-07-02T10:23:24Z","snapshot_observed_at":"2026-08-08T12:42:58.671472Z","submitted_at":"2026-02-09T14:21:58Z","title":"TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions","version":3},"cited_work":{"arxiv_id":"2602.08711","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.08711","snapshot_observed_at":"2026-07-04T17:40:00.898211Z","title":"Timechat-captioner: Scripting multi-scene videos with time-aware and structural audio-visual captions","venue":"cs.CV","work_id":"4c791cdb-a0f4-46ae-b9b5-e951f3741e21","year":2026},"citing_paper":{"arxiv_id":"2606.24636","last_updated":"2026-06-23T14:29:40Z","snapshot_observed_at":"2026-08-07T23:34:44.066451Z","submitted_at":"2026-06-23T14:29:40Z","title":"CineCap: Structured Reasoning with Spatio-Temporal Anchors for Cinematographic Video Captioning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-25T23:29:24.520537Z"},"links":{"cited_paper":"/paper/2602.08711","citing_paper":"/paper/2606.24636"},"observation_digest":"sha256:d67fc33e83618bee3ae02f3506158361b206b92f72898b468f081285d74ad25b","observation_id":"ae5e7b81-915d-4acf-ac1f-cc23263dbccd","resolution":{"observed_at":"2026-07-04T17:40:00.899555Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.08711","last_updated":"2026-07-02T10:23:24Z","snapshot_observed_at":"2026-08-08T12:42:58.671472Z","submitted_at":"2026-02-09T14:21:58Z","title":"TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.08711","snapshot_observed_at":"2026-08-01T10:02:03.266407Z","title":"Timechat- captioner: Scripting multi-scene videos with time-aware and structural audio-visual captions.CoRR, abs/2602.08711, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20389","last_updated":"2026-07-22T17:17:33Z","snapshot_observed_at":"2026-08-07T12:38:32.377959Z","submitted_at":"2026-07-22T17:17:33Z","title":"PercepCap: Video Captioner with Structured Spatio-Temporal Perception","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T10:02:03.266407Z"},"links":{"cited_paper":"/paper/2602.08711","citing_paper":"/paper/2607.20389"},"observation_digest":"sha256:f6f61f9c39d748bcb40802947651a6b8682c56c7508785588125a95d3b49ea74","observation_id":"7deff422-86ba-4f42-a199-15919089ae58","resolution":{"observed_at":"2026-08-01T10:02:03.266407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2602.08711/citation-record","integrity":"/paper/2602.08711/integrity","json":"/paper/2602.08711/citation-record.json","paper":"/paper/2602.08711"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:15:11.405612Z","title":"• Each minute usually contains4–5 segments, but prioritize the video’s logic over strict numbers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.08711","last_updated":"2026-07-02T10:23:24Z","snapshot_observed_at":"2026-08-08T12:42:58.671472Z","submitted_at":"2026-02-09T14:21:58Z","title":"TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T03:15:11.405612Z"},"links":{"citing_paper":"/paper/2602.08711"},"observation_digest":"sha256:44bd0bac5ab96d4826d27a11283f86172b2b8690129f40a3993cede8a6bf3263","observation_id":"4c776e3f-1171-4350-aae9-9bc360072212","resolution":{"observed_at":"2026-08-03T03:15:11.405612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:15:11.419923Z","title":"• Includecharacters, actions, objects, emotions, and scene detailswhere relevant","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.08711","last_updated":"2026-07-02T10:23:24Z","snapshot_observed_at":"2026-08-08T12:42:58.671472Z","submitted_at":"2026-02-09T14:21:58Z","title":"TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T03:15:11.419923Z"},"links":{"citing_paper":"/paper/2602.08711"},"observation_digest":"sha256:bc9659a8acebb6e2f675126c673c40cbbfeef6aa7393923c96d936a0c8d4c1b0","observation_id":"c7a12329-78df-4c02-a3f0-2b912ae77545","resolution":{"observed_at":"2026-08-03T03:15:11.419923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:15:11.451377Z","title":"• Timestamp format:minutes:seconds(e.g.,0:00 - 0:11)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.08711","last_updated":"2026-07-02T10:23:24Z","snapshot_observed_at":"2026-08-08T12:42:58.671472Z","submitted_at":"2026-02-09T14:21:58Z","title":"TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T03:15:11.451377Z"},"links":{"citing_paper":"/paper/2602.08711"},"observation_digest":"sha256:f95fcee6cec63f9393bfb398995c0796dcaff78719f69f9965f604c592c65992","observation_id":"ebf37857-5121-4598-a9ae-5277186fafd9","resolution":{"observed_at":"2026-08-03T03:15:11.451377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:15:11.478148Z","title":"Each GT caption defines the rough boundaries of a segment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.08711","last_updated":"2026-07-02T10:23:24Z","snapshot_observed_at":"2026-08-08T12:42:58.671472Z","submitted_at":"2026-02-09T14:21:58Z","title":"TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T03:15:11.478148Z"},"links":{"citing_paper":"/paper/2602.08711"},"observation_digest":"sha256:1de0f88b08167d323cdb1ef85b55175d144d256e941b63fbbac52dc031dd1d70","observation_id":"ed901d18-4d82-40c8-a04b-510d88aaa265","resolution":{"observed_at":"2026-08-03T03:15:11.478148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:15:11.509777Z","title":"Use the video itself toexpand with details: •Characters: actions, gestures, facial expressions, emotions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.08711","last_updated":"2026-07-02T10:23:24Z","snapshot_observed_at":"2026-08-08T12:42:58.671472Z","submitted_at":"2026-02-09T14:21:58Z","title":"TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T03:15:11.509777Z"},"links":{"citing_paper":"/paper/2602.08711"},"observation_digest":"sha256:b86b1ad8921dbbf7df00c357f8d92606953fa81b96d0b1c7ec34e37e7a33cf67","observation_id":"c71922d9-2cfc-4bca-b50e-9b56dc80e979","resolution":{"observed_at":"2026-08-03T03:15:11.509777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:15:11.541291Z","title":"timestamp","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.08711","last_updated":"2026-07-02T10:23:24Z","snapshot_observed_at":"2026-08-08T12:42:58.671472Z","submitted_at":"2026-02-09T14:21:58Z","title":"TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T03:15:11.541291Z"},"links":{"citing_paper":"/paper/2602.08711"},"observation_digest":"sha256:17ac0aa9dc9a43340adc22bb6c1104585dc87fe5cdcb036072a374dd09843918","observation_id":"163a77b1-b06a-42c1-9fe1-1480feb004d2","resolution":{"observed_at":"2026-08-03T03:15:11.541291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:15:11.569122Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.08711","last_updated":"2026-07-02T10:23:24Z","snapshot_observed_at":"2026-08-08T12:42:58.671472Z","submitted_at":"2026-02-09T14:21:58Z","title":"TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T03:15:11.569122Z"},"links":{"citing_paper":"/paper/2602.08711"},"observation_digest":"sha256:eba5e4980a662cd328b7be41d98b04d72421c99034dd1b6428c51ee73f703756","observation_id":"a576c31c-d18f-463f-b3fd-044dad84c7e8","resolution":{"observed_at":"2026-08-03T03:15:11.569122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:15:11.601779Z","title":"by_dim\": {","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.08711","last_updated":"2026-07-02T10:23:24Z","snapshot_observed_at":"2026-08-08T12:42:58.671472Z","submitted_at":"2026-02-09T14:21:58Z","title":"TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T03:15:11.601779Z"},"links":{"citing_paper":"/paper/2602.08711"},"observation_digest":"sha256:cc989870239e3d61a9cce80907c4246df8e9e2deb163fde642ef75046a909a0c","observation_id":"8bbc8a29-9465-4f13-b4cf-9b98fa517a21","resolution":{"observed_at":"2026-08-03T03:15:11.601779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-08-03T03:15:11.377213Z","title":"timestamp","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.08711","last_updated":"2026-07-02T10:23:24Z","snapshot_observed_at":"2026-08-08T12:42:58.671472Z","submitted_at":"2026-02-09T14:21:58Z","title":"TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T03:15:11.377213Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2602.08711"},"observation_digest":"sha256:61a877af242a2a144b585505a9a64c680b7f335bd99617d349d59ac265604514","observation_id":"95218483-f9a3-4ebb-b2e0-62ea836414ee","resolution":{"observed_at":"2026-08-03T03:15:11.377213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.08711","last_updated":"2026-07-02T10:23:24Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T12:42:58.671472Z","submitted_at":"2026-02-09T14:21:58Z","title":"TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions"},"reference_resolution":{"displayed":9,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":9},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 9 of 9 outbound references and 4 inbound Pith citation observations for arXiv:2602.08711."}