{"as_of":"2026-08-09T07:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:67a6dc38e8c1df72532cf672941361f3387d70624b125fcebfc3aa1b68e19e86","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":7,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":7,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:35:45.865632Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T13:17:18.523647Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.08282","last_updated":"2025-06-01T17:32:19Z","snapshot_observed_at":"2026-08-06T03:07:46.739669Z","submitted_at":"2025-01-14T17:58:12Z","title":"LLaVA-ST: A Multimodal Large Language Model for Fine-Grained Spatial-Temporal Understanding","version":2},"cited_work":{"arxiv_id":"2501.08282","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.08282","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LLaVA-ST: A Multimodal Large Language Model for Fine-Grained Spatial-Temporal Understanding","venue":null,"work_id":"f6e17099-00d3-4315-ac3d-4292ae5e922c","year":2025},"citing_paper":{"arxiv_id":"2505.20715","last_updated":"2026-04-18T02:55:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-27T04:50:07Z","title":"MUSEG: Reinforcing Video Temporal Understanding via Timestamp-Aware Multi-Segment Grounding","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-19T13:13:40.485342Z"},"links":{"cited_paper":"/paper/2501.08282","citing_paper":"/paper/2505.20715"},"observation_digest":"sha256:42ca8fa115dbfa2c3174a3aea9b5b4984dcac20c16c72f7cf4c4d13f564d41f6","observation_id":"8994b48c-70a8-44b5-8d48-9514de05ad00","resolution":{"observed_at":"2026-05-19T13:17:18.526285Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08282","last_updated":"2025-06-01T17:32:19Z","snapshot_observed_at":"2026-08-06T03:07:46.739669Z","submitted_at":"2025-01-14T17:58:12Z","title":"LLaVA-ST: A Multimodal Large Language Model for Fine-Grained Spatial-Temporal Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08282","snapshot_observed_at":"2026-08-07T11:35:45.865632Z","title":"Llava-st: A multimodal large language model for fine-grained spatial-temporal understanding.arXiv preprint arXiv:2501.08282, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:45.865632Z"},"links":{"cited_paper":"/paper/2501.08282","citing_paper":"/paper/2506.01908"},"observation_digest":"sha256:ada416a27cd5b516f1eab4d7068e51c5cb20522502991023c177d77238261d35","observation_id":"f79c5a1c-78e4-4915-8011-72b2ac8f5279","resolution":{"observed_at":"2026-08-07T11:35:45.865632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08282","last_updated":"2025-06-01T17:32:19Z","snapshot_observed_at":"2026-08-06T03:07:46.739669Z","submitted_at":"2025-01-14T17:58:12Z","title":"LLaVA-ST: A Multimodal Large Language Model for Fine-Grained Spatial-Temporal Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08282","snapshot_observed_at":"2026-08-07T11:03:17.170264Z","title":"Llava-st: A multimodal large language model for fine-grained spatial- temporal understanding.arXiv preprint arXiv:2501.08282,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03737","last_updated":"2025-06-04T09:10:02Z","snapshot_observed_at":"2026-08-07T10:54:06.803362Z","submitted_at":"2025-06-04T09:10:02Z","title":"ComRoPE: Scalable and Robust Rotary Position Embedding Parameterized by Trainable Commuting Angle Matrices","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:17.170264Z"},"links":{"cited_paper":"/paper/2501.08282","citing_paper":"/paper/2506.03737"},"observation_digest":"sha256:88366f1c8826356b792beb43cb02083108507680cc111c817bb7773acbada743","observation_id":"396438cd-7478-4801-ac34-1f5cec8d7300","resolution":{"observed_at":"2026-08-07T11:03:17.170264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08282","last_updated":"2025-06-01T17:32:19Z","snapshot_observed_at":"2026-08-06T03:07:46.739669Z","submitted_at":"2025-01-14T17:58:12Z","title":"LLaVA-ST: A Multimodal Large Language Model for Fine-Grained Spatial-Temporal Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08282","snapshot_observed_at":"2026-08-05T23:32:17.977612Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-06T10:35:41.875223Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":114,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.977612Z"},"links":{"cited_paper":"/paper/2501.08282","citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:0a84b02f65c3288fbca004fc63543ae49914cebcbb0a01233076fc55d934eef5","observation_id":"703cec36-f077-4afb-9766-b3706ce35412","resolution":{"observed_at":"2026-08-05T23:32:17.977612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08282","last_updated":"2025-06-01T17:32:19Z","snapshot_observed_at":"2026-08-06T03:07:46.739669Z","submitted_at":"2025-01-14T17:58:12Z","title":"LLaVA-ST: A Multimodal Large Language Model for Fine-Grained Spatial-Temporal Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08282","snapshot_observed_at":"2026-08-05T19:06:23.616871Z","title":"Llava-st: A multimodal large language model for fine-grained spatial- temporal understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-05T19:06:03.891544Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:23.616871Z"},"links":{"cited_paper":"/paper/2501.08282","citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:cda5e77def86984dbcc75ce0e62b921bafd9f853c9d8c0f33f78fc110c7ee89e","observation_id":"323ef9e9-47cc-41dc-8691-b32fc052179e","resolution":{"observed_at":"2026-08-05T19:06:23.616871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08282","last_updated":"2025-06-01T17:32:19Z","snapshot_observed_at":"2026-08-06T03:07:46.739669Z","submitted_at":"2025-01-14T17:58:12Z","title":"LLaVA-ST: A Multimodal Large Language Model for Fine-Grained Spatial-Temporal Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08282","snapshot_observed_at":"2026-08-05T18:06:00.350739Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.15232","last_updated":"2025-08-21T04:43:35Z","snapshot_observed_at":"2026-08-07T11:07:22.139611Z","submitted_at":"2025-08-21T04:43:35Z","title":"AeroDuo: Aerial Duo for UAV-based Vision and Language Navigation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T18:06:00.350739Z"},"links":{"cited_paper":"/paper/2501.08282","citing_paper":"/paper/2508.15232"},"observation_digest":"sha256:77b608507fb3dcc901fba50a373a8b8b392ac9d528b1ee704817636cbe4d264e","observation_id":"2290a2b5-f67c-4115-89b0-d84a337444eb","resolution":{"observed_at":"2026-08-05T18:06:00.350739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08282","last_updated":"2025-06-01T17:32:19Z","snapshot_observed_at":"2026-08-06T03:07:46.739669Z","submitted_at":"2025-01-14T17:58:12Z","title":"LLaVA-ST: A Multimodal Large Language Model for Fine-Grained Spatial-Temporal Understanding","version":2},"cited_work":{"arxiv_id":"2501.08282","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.08282","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LLaVA-ST: A Multimodal Large Language Model for Fine-Grained Spatial-Temporal Understanding","venue":null,"work_id":"f6e17099-00d3-4315-ac3d-4292ae5e922c","year":2025},"citing_paper":{"arxiv_id":"2604.12148","last_updated":"2026-04-13T23:54:58Z","snapshot_observed_at":"2026-08-03T13:03:27.832426Z","submitted_at":"2026-04-13T23:54:58Z","title":"ViLL-E: Video LLM Embeddings for Retrieval","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T15:00:43.573409Z"},"links":{"cited_paper":"/paper/2501.08282","citing_paper":"/paper/2604.12148"},"observation_digest":"sha256:e220d147d618113de07c7d4cbb8be7bd094472a27ceea26ba2dd4a58f5eeacfb","observation_id":"3fb88a8f-e1f4-4ad4-aef7-ba939d81714e","resolution":{"observed_at":"2026-05-11T11:21:01.954274Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.08282/citation-record","integrity":"/paper/2501.08282/integrity","json":"/paper/2501.08282/citation-record.json","paper":"/paper/2501.08282"},"outbound":[],"paper":{"arxiv_id":"2501.08282","last_updated":"2025-06-01T17:32:19Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T03:07:46.739669Z","submitted_at":"2025-01-14T17:58:12Z","title":"LLaVA-ST: A Multimodal Large Language Model for Fine-Grained Spatial-Temporal Understanding"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 7 inbound Pith citation observations for arXiv:2501.08282."}