{"as_of":"2026-08-15T06:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0c5fe438668156547a1c72c9c4eab778f18019754f19173bd534ad261e267d5f","coverage":[{"denominator":18,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T14:06:16.767341Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.10932/citation-record","integrity":"/paper/2608.10932/integrity","json":"/paper/2608.10932/citation-record.json","paper":"/paper/2608.10932"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-15T04:53:45.483331Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-12T14:06:16.718672Z","title":"Layer normalization.arXiv preprint arXiv:1607.06450,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10932","last_updated":"2026-08-11T14:00:02Z","snapshot_observed_at":"2026-08-14T23:12:19.619353Z","submitted_at":"2026-08-11T14:00:02Z","title":"Temporally Grounded Compositional Camera Motion Understanding via Geometric Knowledge Distillation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T14:06:16.718672Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2608.10932"},"observation_digest":"sha256:8bb4c2a1d7d9fe325a0ade1d7cc3f8f6d1c96a2a48033b737b1f9194664abdcb","observation_id":"638df983-383b-43a4-a9a7-634935fe8208","resolution":{"observed_at":"2026-08-12T14:06:16.718672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-12T14:06:16.737321Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10932","last_updated":"2026-08-11T14:00:02Z","snapshot_observed_at":"2026-08-14T23:12:19.619353Z","submitted_at":"2026-08-11T14:00:02Z","title":"Temporally Grounded Compositional Camera Motion Understanding via Geometric Knowledge Distillation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T14:06:16.737321Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2608.10932"},"observation_digest":"sha256:7d060c2bd650650dab405481f9a77a5abec58b392b9b070b399c4fab80a0ccfd","observation_id":"7ef75b17-3d7f-45bb-a374-8f04efbfe663","resolution":{"observed_at":"2026-08-12T14:06:16.737321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12223","last_updated":"2025-03-28T03:50:25Z","snapshot_observed_at":"2026-08-14T03:18:45.580820Z","submitted_at":"2024-12-16T09:02:24Z","title":"Can video generation replace cinematographers? Research on the cinematic language of generated video","version":2},"cited_work":{"arxiv_id":"2412.12223","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.12223","snapshot_observed_at":"2026-08-12T14:06:17.109079Z","title":"Can video generation replace cinematographers? Research on the cinematic language of generated video","venue":"cs.CV","work_id":"7454419c-d738-4101-810e-24a4519ea383","year":2024},"citing_paper":{"arxiv_id":"2608.10932","last_updated":"2026-08-11T14:00:02Z","snapshot_observed_at":"2026-08-14T23:12:19.619353Z","submitted_at":"2026-08-11T14:00:02Z","title":"Temporally Grounded Compositional Camera Motion Understanding via Geometric Knowledge Distillation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T14:06:16.740457Z"},"links":{"cited_paper":"/paper/2412.12223","citing_paper":"/paper/2608.10932"},"observation_digest":"sha256:a3934770e972e70ce8646f18fdbce42f1d2462f89de35905b5be4b7a122ce063","observation_id":"ef6adfc5-8d40-421e-8d1c-141d5467603e","resolution":{"observed_at":"2026-08-12T14:06:17.112505Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-15T00:17:32.875866Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-08-12T14:06:16.743214Z","title":"Openai gpt-5 system card.arXiv preprint arXiv:2601.03267,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10932","last_updated":"2026-08-11T14:00:02Z","snapshot_observed_at":"2026-08-14T23:12:19.619353Z","submitted_at":"2026-08-11T14:00:02Z","title":"Temporally Grounded Compositional Camera Motion Understanding via Geometric Knowledge Distillation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T14:06:16.743214Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2608.10932"},"observation_digest":"sha256:eddd7d7d7cbb02de6d5c20eda6e0051a4d67d5be619ee604d93be0ff718c1e46","observation_id":"8ba3fc51-3215-4174-8864-3070c349db14","resolution":{"observed_at":"2026-08-12T14:06:16.743214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:06:17.690136Z","title":"Per-class difficulty and the long tail.Figure 9 reports frame-level F1 for all 20 direction-aware labels","venue":null,"work_id":"1759da95-5157-4d42-beb4-075c1ea7fbfb","year":2000},"citing_paper":{"arxiv_id":"2608.10932","last_updated":"2026-08-11T14:00:02Z","snapshot_observed_at":"2026-08-14T23:12:19.619353Z","submitted_at":"2026-08-11T14:00:02Z","title":"Temporally Grounded Compositional Camera Motion Understanding via Geometric Knowledge Distillation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T14:06:16.767341Z"},"links":{"citing_paper":"/paper/2608.10932"},"observation_digest":"sha256:a2d25a43e3f99c555bfdc6e68c66d63303cc237078a0839e737deec102b3b962","observation_id":"0e44e870-1d8d-47c5-bb89-dbbee7901342","resolution":{"observed_at":"2026-08-12T14:06:17.693248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.22819","last_updated":"2026-07-23T02:53:47Z","snapshot_observed_at":"2026-08-02T13:29:27.256254Z","submitted_at":"2026-05-21T17:59:45Z","title":"Cambrian-P: Pose-Grounded Video Understanding","version":2},"cited_work":{"arxiv_id":"2605.22819","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.22819","snapshot_observed_at":"2026-08-12T14:06:17.014788Z","title":"Cambrian-P: Pose-Grounded Video Understanding","venue":"cs.CV","work_id":"b8a38f96-1f6f-4daf-a688-4e3f84b66cbf","year":2026},"citing_paper":{"arxiv_id":"2608.10932","last_updated":"2026-08-11T14:00:02Z","snapshot_observed_at":"2026-08-14T23:12:19.619353Z","submitted_at":"2026-08-11T14:00:02Z","title":"Temporally Grounded Compositional Camera Motion Understanding via Geometric Knowledge Distillation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T14:06:16.754066Z"},"links":{"cited_paper":"/paper/2605.22819","citing_paper":"/paper/2608.10932"},"observation_digest":"sha256:f379386e964d3f7d3f8f1e2e93e9d2aa89d132e7ea9d22d4e0bc48391ed2d612","observation_id":"13730a63-c831-49d2-8bd9-5f1a2051b3b3","resolution":{"observed_at":"2026-08-12T14:06:17.020445Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-12T14:06:16.759467Z","title":"Llava-video: Video instruction tuning with synthetic data.arXiv preprint arXiv:2410.02713,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10932","last_updated":"2026-08-11T14:00:02Z","snapshot_observed_at":"2026-08-14T23:12:19.619353Z","submitted_at":"2026-08-11T14:00:02Z","title":"Temporally Grounded Compositional Camera Motion Understanding via Geometric Knowledge Distillation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T14:06:16.759467Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2608.10932"},"observation_digest":"sha256:67327faa71dcd9943937f96acbc1476b1565f83d5097e42d779dee9c4eb8bcb9","observation_id":"eacf236a-1c70-4939-b6bd-afc919ad34b1","resolution":{"observed_at":"2026-08-12T14:06:16.759467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:06:17.706732Z","title":"These pipelines can be slow and brittle under low texture or pure rotation","venue":null,"work_id":"4925b8e8-83be-40d0-9b95-346e2d654860","year":2021},"citing_paper":{"arxiv_id":"2608.10932","last_updated":"2026-08-11T14:00:02Z","snapshot_observed_at":"2026-08-14T23:12:19.619353Z","submitted_at":"2026-08-11T14:00:02Z","title":"Temporally Grounded Compositional Camera Motion Understanding via Geometric Knowledge Distillation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T14:06:16.762050Z"},"links":{"citing_paper":"/paper/2608.10932"},"observation_digest":"sha256:99ad591b1021a14b2160359bd11a39f812a6b2615d757cdc74d40556785d687e","observation_id":"932e66e0-37f0-4116-ae26-8141d93de4a3","resolution":{"observed_at":"2026-08-12T14:06:17.709719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:06:17.698316Z","title":"Large annotated resources such as SpatialVID (Wang et al., 2025a) further support progress in video geometry","venue":null,"work_id":"c80f0984-09cc-493e-b2f3-32cce201bf7f","year":null},"citing_paper":{"arxiv_id":"2608.10932","last_updated":"2026-08-11T14:00:02Z","snapshot_observed_at":"2026-08-14T23:12:19.619353Z","submitted_at":"2026-08-11T14:00:02Z","title":"Temporally Grounded Compositional Camera Motion Understanding via Geometric Knowledge Distillation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T14:06:16.764609Z"},"links":{"citing_paper":"/paper/2608.10932"},"observation_digest":"sha256:8557ecee19fc6604def81db24d58fbc0146b1d023032b231de9c66d9afe14cec","observation_id":"9fcab7f1-5cb8-4dd2-af0f-7d28cb9472af","resolution":{"observed_at":"2026-08-12T14:06:17.701653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:06:16.727896Z","title":"Geometry-guided camera motion under- standing in videollms.arXiv preprint arXiv:2603.13119,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10932","last_updated":"2026-08-11T14:00:02Z","snapshot_observed_at":"2026-08-14T23:12:19.619353Z","submitted_at":"2026-08-11T14:00:02Z","title":"Temporally Grounded Compositional Camera Motion Understanding via Geometric Knowledge Distillation","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-12T14:06:16.727896Z"},"links":{"citing_paper":"/paper/2608.10932"},"observation_digest":"sha256:b652fa3e3691e654475e856ccc971d235adae1e22d847390117658ee752d74e3","observation_id":"919fec3a-63a6-4dba-b4a8-1a2f85c64d0d","resolution":{"observed_at":"2026-08-12T14:06:16.727896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10934","last_updated":"2025-08-12T18:39:13Z","snapshot_observed_at":"2026-08-14T06:25:22.731553Z","submitted_at":"2025-08-12T18:39:13Z","title":"ViPE: Video Pose Engine for 3D Geometric Perception","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10934","snapshot_observed_at":"2026-08-12T14:06:16.734244Z","title":"Vipe: Video pose engine for 3d geometric perception.arXiv preprint arXiv:2508.10934,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10932","last_updated":"2026-08-11T14:00:02Z","snapshot_observed_at":"2026-08-14T23:12:19.619353Z","submitted_at":"2026-08-11T14:00:02Z","title":"Temporally Grounded Compositional Camera Motion Understanding via Geometric Knowledge Distillation","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-12T14:06:16.734244Z"},"links":{"cited_paper":"/paper/2508.10934","citing_paper":"/paper/2608.10932"},"observation_digest":"sha256:9ccd975046496f7297e26506e84d5db0777cab2686e8f31e2398a6ae197788e4","observation_id":"3c7af0bf-4133-4724-b9ea-e5fa8756da28","resolution":{"observed_at":"2026-08-12T14:06:16.734244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-11T14:42:37.584016Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-12T14:06:16.722169Z","title":"Recammaster: Camera-controlled generative rendering from a single video","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10932","last_updated":"2026-08-11T14:00:02Z","snapshot_observed_at":"2026-08-14T23:12:19.619353Z","submitted_at":"2026-08-11T14:00:02Z","title":"Temporally Grounded Compositional Camera Motion Understanding via Geometric Knowledge Distillation","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-12T14:06:16.722169Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.10932"},"observation_digest":"sha256:b60403b68b8b578d54551de89cb19de7a81ad43a76140bd3bfd96706274664af","observation_id":"4f0defbf-9fb8-4006-bcc5-bd6e43443222","resolution":{"observed_at":"2026-08-12T14:06:16.722169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:06:16.748622Z","title":"Spatialvid: A large-scale video dataset with spatial annotations.arXiv preprint arXiv:2509.09676, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10932","last_updated":"2026-08-11T14:00:02Z","snapshot_observed_at":"2026-08-14T23:12:19.619353Z","submitted_at":"2026-08-11T14:00:02Z","title":"Temporally Grounded Compositional Camera Motion Understanding via Geometric Knowledge Distillation","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-12T14:06:16.748622Z"},"links":{"citing_paper":"/paper/2608.10932"},"observation_digest":"sha256:18efce52a113c81f26b2492e0a3c1664efa79905651f2769c2961de28eaaf5c5","observation_id":"d506abec-4dcc-43c0-aa0d-b756d3525552","resolution":{"observed_at":"2026-08-12T14:06:16.748622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-12T14:06:16.745790Z","title":"Siglip 2: Multilingual vision-language encoders with improved semantic understanding, localization, and dense features.arXiv preprint arXiv:2502.14786,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10932","last_updated":"2026-08-11T14:00:02Z","snapshot_observed_at":"2026-08-14T23:12:19.619353Z","submitted_at":"2026-08-11T14:00:02Z","title":"Temporally Grounded Compositional Camera Motion Understanding via Geometric Knowledge Distillation","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-12T14:06:16.745790Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2608.10932"},"observation_digest":"sha256:daefdbe9a947869c26f801cf330759f0e2d6ea865551ccc38b75889fe858bc6a","observation_id":"96cb87b2-6162-49a9-8064-6cc4d9067153","resolution":{"observed_at":"2026-08-12T14:06:16.745790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:06:16.756804Z","title":"On the generalization capacities of mllms for spatial intelligence.arXiv preprint arXiv:2603.06704,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10932","last_updated":"2026-08-11T14:00:02Z","snapshot_observed_at":"2026-08-14T23:12:19.619353Z","submitted_at":"2026-08-11T14:00:02Z","title":"Temporally Grounded Compositional Camera Motion Understanding via Geometric Knowledge Distillation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-12T14:06:16.756804Z"},"links":{"citing_paper":"/paper/2608.10932"},"observation_digest":"sha256:4a8234be09d87c213c7ba9e3ecd2384a97fc0dbb25d0d62dff7341c666da5b1c","observation_id":"73db782a-147a-489f-82ec-03ac4a884bdc","resolution":{"observed_at":"2026-08-12T14:06:16.756804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-08-13T04:48:56.237545Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-12T14:06:16.751373Z","title":"Internvl3.5: Advancing open-source multimodal models in versatility, reasoning, and efficiency.arXiv preprint arXiv:2508.18265, 2025c","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.10932","last_updated":"2026-08-11T14:00:02Z","snapshot_observed_at":"2026-08-14T23:12:19.619353Z","submitted_at":"2026-08-11T14:00:02Z","title":"Temporally Grounded Compositional Camera Motion Understanding via Geometric Knowledge Distillation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-12T14:06:16.751373Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2608.10932"},"observation_digest":"sha256:4e05093caceac38c97cb261a7870e014fc0bd9afca631ca00bed9c8c61313c8e","observation_id":"b520f7e9-dbf6-4e28-b679-a1633d6d9d15","resolution":{"observed_at":"2026-08-12T14:06:16.751373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-12T14:06:16.725005Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale.arXiv preprint arXiv:2010.11929,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.10932","last_updated":"2026-08-11T14:00:02Z","snapshot_observed_at":"2026-08-14T23:12:19.619353Z","submitted_at":"2026-08-11T14:00:02Z","title":"Temporally Grounded Compositional Camera Motion Understanding via Geometric Knowledge Distillation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-12T14:06:16.725005Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2608.10932"},"observation_digest":"sha256:3013530f67e8699fea3949c9bdc50557898fc1a80084ab8a7f23799b2800f97d","observation_id":"643ce842-46c7-48c9-8ce9-c661f39bd7e2","resolution":{"observed_at":"2026-08-12T14:06:16.725005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-08-14T22:57:08.956233Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-12T14:06:16.730579Z","title":"Distilling the knowledge in a neural network.arXiv preprint arXiv:1503.02531,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10932","last_updated":"2026-08-11T14:00:02Z","snapshot_observed_at":"2026-08-14T23:12:19.619353Z","submitted_at":"2026-08-11T14:00:02Z","title":"Temporally Grounded Compositional Camera Motion Understanding via Geometric Knowledge Distillation","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-12T14:06:16.730579Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2608.10932"},"observation_digest":"sha256:7c15bddcb5a43ffe0406d3b25f4d8c88156319e3ad50a447806fe068c42585fc","observation_id":"6ec89010-04af-4130-aa4b-7eaade060fe8","resolution":{"observed_at":"2026-08-12T14:06:16.730579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.10932","last_updated":"2026-08-11T14:00:02Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T23:12:19.619353Z","submitted_at":"2026-08-11T14:00:02Z","title":"Temporally Grounded Compositional Camera Motion Understanding via Geometric Knowledge Distillation"},"reference_resolution":{"displayed":18,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":2,"verified_fuzzy":3},"total_outbound_references":18},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 18 of 18 outbound references and 0 inbound Pith citation observations for arXiv:2608.10932."}