{"as_of":"2026-08-09T11:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:06b9cd1b7f07087ed57440a3a25eda9c16ad3a8e40a53fae8c9bb181133eade0","coverage":[{"denominator":18,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T23:56:52.009530Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.03789/citation-record","integrity":"/paper/2607.03789/integrity","json":"/paper/2607.03789/citation-record.json","paper":"/paper/2607.03789"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.14151","last_updated":"2025-04-19T02:51:24Z","snapshot_observed_at":"2026-08-07T16:00:59.483600Z","submitted_at":"2025-04-19T02:51:24Z","title":"Locate 3D: Real-World Object Localization via Self-Supervised Learning in 3D","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14151","snapshot_observed_at":"2026-07-11T23:56:52.009530Z","title":"M., Thomas, P., Partsey, R., Dugas, D., Gejji, A., Sax, A., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03789","last_updated":"2026-07-04T09:32:13Z","snapshot_observed_at":"2026-08-08T01:59:20.644759Z","submitted_at":"2026-07-04T09:32:13Z","title":"G$^2$TAM: Geometry Grounded Track Anything Model","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T23:56:52.009530Z"},"links":{"cited_paper":"/paper/2504.14151","citing_paper":"/paper/2607.03789"},"observation_digest":"sha256:4fce3731c561e937bcee3378e2db8a44107854438f2e768ed6add67b34b5edce","observation_id":"a0e79cc5-f833-4f3d-98fe-fe58c9fc55c4","resolution":{"observed_at":"2026-07-11T23:56:52.009530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.08897","last_updated":"2022-01-12T08:19:29Z","snapshot_observed_at":"2026-07-06T12:09:19.763667Z","submitted_at":"2021-11-17T04:27:01Z","title":"ARKitScenes: A Diverse Real-World Dataset For 3D Indoor Scene Understanding Using Mobile RGB-D Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.08897","snapshot_observed_at":"2026-07-11T23:56:52.009530Z","title":"Arkitscenes: A diverse real-world dataset for 3d in- door scene understanding using mobile rgb-d data.arXiv preprint arXiv:2111.08897,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03789","last_updated":"2026-07-04T09:32:13Z","snapshot_observed_at":"2026-08-08T01:59:20.644759Z","submitted_at":"2026-07-04T09:32:13Z","title":"G$^2$TAM: Geometry Grounded Track Anything Model","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T23:56:52.009530Z"},"links":{"cited_paper":"/paper/2111.08897","citing_paper":"/paper/2607.03789"},"observation_digest":"sha256:ba83af4b8d1e9081b4390c0a5126c29b6c961b3abc0230f91cb685e5823804bb","observation_id":"eb859ce0-9be2-4510-afe3-b46617973ccf","resolution":{"observed_at":"2026-07-11T23:56:52.009530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-06T18:30:13.912827Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07781","snapshot_observed_at":"2026-07-11T23:56:52.009530Z","title":"Surprise3d: A dataset for spatial understanding and reasoning in complex 3d scenes.arXiv preprint arXiv:2507.07781,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03789","last_updated":"2026-07-04T09:32:13Z","snapshot_observed_at":"2026-08-08T01:59:20.644759Z","submitted_at":"2026-07-04T09:32:13Z","title":"G$^2$TAM: Geometry Grounded Track Anything Model","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T23:56:52.009530Z"},"links":{"cited_paper":"/paper/2507.07781","citing_paper":"/paper/2607.03789"},"observation_digest":"sha256:ee87e665d42708d66d9c9a96d56db17ce4189623d08dba477e05ac29a3f526f7","observation_id":"01684f2e-885d-4528-b5d0-182573a6ee2e","resolution":{"observed_at":"2026-07-11T23:56:52.009530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:56:52.009530Z","title":"Crafting papers on machine learning","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2607.03789","last_updated":"2026-07-04T09:32:13Z","snapshot_observed_at":"2026-08-08T01:59:20.644759Z","submitted_at":"2026-07-04T09:32:13Z","title":"G$^2$TAM: Geometry Grounded Track Anything Model","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-11T23:56:52.009530Z"},"links":{"citing_paper":"/paper/2607.03789"},"observation_digest":"sha256:178007f89b4c1eb27655f96e5988adb422cb152f4e1f18f1649e60c3e7bd3bbc","observation_id":"593fcb7d-99d2-4276-83f8-2ed8bf40478b","resolution":{"observed_at":"2026-07-11T23:56:52.009530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04767","last_updated":"2023-07-10T17:59:40Z","snapshot_observed_at":"2026-08-06T16:51:13.365740Z","submitted_at":"2023-07-10T17:59:40Z","title":"Semantic-SAM: Segment and Recognize Anything at Any Granularity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04767","snapshot_observed_at":"2026-07-11T23:56:52.009530Z","title":"Semantic-sam: Segment and recognize anything at any granularity.arXiv preprint arXiv:2307.04767,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03789","last_updated":"2026-07-04T09:32:13Z","snapshot_observed_at":"2026-08-08T01:59:20.644759Z","submitted_at":"2026-07-04T09:32:13Z","title":"G$^2$TAM: Geometry Grounded Track Anything Model","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-11T23:56:52.009530Z"},"links":{"cited_paper":"/paper/2307.04767","citing_paper":"/paper/2607.03789"},"observation_digest":"sha256:a973337efa991ef7b44afa9c597f30cdbb17abc3255251b8e7276cb45a68e92e","observation_id":"5f8defb1-5b75-4237-8d1c-43c81f2000b1","resolution":{"observed_at":"2026-07-11T23:56:52.009530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14607","last_updated":"2025-06-30T16:09:19Z","snapshot_observed_at":"2026-07-06T20:25:40.715105Z","submitted_at":"2025-01-24T16:24:15Z","title":"ReferDINO: Referring Video Object Segmentation with Visual Grounding Foundations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14607","snapshot_observed_at":"2026-07-11T23:56:52.009530Z","title":"Referdino: Referring video object segmenta- tion with visual grounding foundations.arXiv preprint arXiv:2501.14607,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03789","last_updated":"2026-07-04T09:32:13Z","snapshot_observed_at":"2026-08-08T01:59:20.644759Z","submitted_at":"2026-07-04T09:32:13Z","title":"G$^2$TAM: Geometry Grounded Track Anything Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T23:56:52.009530Z"},"links":{"cited_paper":"/paper/2501.14607","citing_paper":"/paper/2607.03789"},"observation_digest":"sha256:ea003169ff235f1c523d47ecba165437c792050c7b2c9399cd16a7f2334087b3","observation_id":"1ad0b777-8d58-4ecf-9391-9c849c917c3d","resolution":{"observed_at":"2026-07-11T23:56:52.009530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T23:56:52.009530Z","title":"Dinov2: Learning robust visual features without supervision.arXiv preprint arXiv:2304.07193,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03789","last_updated":"2026-07-04T09:32:13Z","snapshot_observed_at":"2026-08-08T01:59:20.644759Z","submitted_at":"2026-07-04T09:32:13Z","title":"G$^2$TAM: Geometry Grounded Track Anything Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T23:56:52.009530Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2607.03789"},"observation_digest":"sha256:84fdd4cbb6f42f9131924211b5273706965a834fb967f6b4a5dc740e86bc7ebd","observation_id":"0ab1d252-937b-42ed-8cd4-8684e05b8c26","resolution":{"observed_at":"2026-07-11T23:56:52.009530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.00675","last_updated":"2018-03-01T17:50:08Z","snapshot_observed_at":"2026-08-02T10:51:13.194643Z","submitted_at":"2017-04-03T16:44:46Z","title":"The 2017 DAVIS Challenge on Video Object Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.00675","snapshot_observed_at":"2026-07-11T23:56:52.009530Z","title":"The 2017 davis chal- lenge on video object segmentation.arXiv preprint arXiv:1704.00675,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.03789","last_updated":"2026-07-04T09:32:13Z","snapshot_observed_at":"2026-08-08T01:59:20.644759Z","submitted_at":"2026-07-04T09:32:13Z","title":"G$^2$TAM: Geometry Grounded Track Anything Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-11T23:56:52.009530Z"},"links":{"cited_paper":"/paper/1704.00675","citing_paper":"/paper/2607.03789"},"observation_digest":"sha256:1681fa25413bcd76c56b32f7a8fa1f1d622e00ce75cfca177c5e9296a44cd635","observation_id":"09f78e15-5830-44b7-9092-fb2f376a6ba7","resolution":{"observed_at":"2026-07-11T23:56:52.009530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-07-11T23:56:52.009530Z","title":"Roh, J., Desingh, K., Farhadi, A., and Fox, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03789","last_updated":"2026-07-04T09:32:13Z","snapshot_observed_at":"2026-08-08T01:59:20.644759Z","submitted_at":"2026-07-04T09:32:13Z","title":"G$^2$TAM: Geometry Grounded Track Anything Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-11T23:56:52.009530Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2607.03789"},"observation_digest":"sha256:778fd9dfaae828fe7bbc9b46053dad5fa8ad3ebfa69d6f3e4b3d2cfd74af9158","observation_id":"ed0f0878-fbc9-4785-8cbb-ceb0fa58f3ed","resolution":{"observed_at":"2026-07-11T23:56:52.009530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13347","last_updated":"2026-03-07T07:01:59Z","snapshot_observed_at":"2026-08-02T12:12:15.465550Z","submitted_at":"2025-07-17T17:59:53Z","title":"$\\pi^3$: Permutation-Equivariant Visual Geometry Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13347","snapshot_observed_at":"2026-07-11T23:56:52.009530Z","title":"URL https://arxiv.org/abs/2507.13347","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03789","last_updated":"2026-07-04T09:32:13Z","snapshot_observed_at":"2026-08-08T01:59:20.644759Z","submitted_at":"2026-07-04T09:32:13Z","title":"G$^2$TAM: Geometry Grounded Track Anything Model","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T23:56:52.009530Z"},"links":{"cited_paper":"/paper/2507.13347","citing_paper":"/paper/2607.03789"},"observation_digest":"sha256:b24d27dd91d7adf225548e6610082a39d8e4a7fbd36228e39eb973129f46d474","observation_id":"c1068309-5839-4e15-a8fd-e9afc634e3f9","resolution":{"observed_at":"2026-07-11T23:56:52.009530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13860","last_updated":"2024-10-17T17:59:55Z","snapshot_observed_at":"2026-07-06T19:35:30.732080Z","submitted_at":"2024-10-17T17:59:55Z","title":"VLM-Grounder: A VLM Agent for Zero-Shot 3D Visual Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13860","snapshot_observed_at":"2026-07-11T23:56:52.009530Z","title":"Vlm-grounder: A vlm agent for zero-shot 3d visual grounding.arXiv preprint arXiv:2410.13860,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03789","last_updated":"2026-07-04T09:32:13Z","snapshot_observed_at":"2026-08-08T01:59:20.644759Z","submitted_at":"2026-07-04T09:32:13Z","title":"G$^2$TAM: Geometry Grounded Track Anything Model","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-11T23:56:52.009530Z"},"links":{"cited_paper":"/paper/2410.13860","citing_paper":"/paper/2607.03789"},"observation_digest":"sha256:83553405cd6102a3f541b279ffe4c99f6e8864729be1cdd884153d8500da633e","observation_id":"75455b46-ea1f-4277-91c1-37e3a05e8699","resolution":{"observed_at":"2026-07-11T23:56:52.009530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04001","last_updated":"2025-11-03T17:35:29Z","snapshot_observed_at":"2026-08-08T01:58:42.644918Z","submitted_at":"2025-01-07T18:58:54Z","title":"Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04001","snapshot_observed_at":"2026-07-11T23:56:52.009530Z","title":"Sa2va: Marrying sam2 with llava for dense grounded understanding of images and videos.arXiv preprint arXiv:2501.04001,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03789","last_updated":"2026-07-04T09:32:13Z","snapshot_observed_at":"2026-08-08T01:59:20.644759Z","submitted_at":"2026-07-04T09:32:13Z","title":"G$^2$TAM: Geometry Grounded Track Anything Model","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-11T23:56:52.009530Z"},"links":{"cited_paper":"/paper/2501.04001","citing_paper":"/paper/2607.03789"},"observation_digest":"sha256:6c4861fca9fb0c8d5e1134c6b0d0686589b4b8770e8e7e0c4ad1c7bacbfc72e2","observation_id":"f60f7822-4f5f-4953-a487-ded8df6f07c8","resolution":{"observed_at":"2026-07-11T23:56:52.009530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13505","last_updated":"2025-04-30T07:19:18Z","snapshot_observed_at":"2026-07-06T16:10:31.087739Z","submitted_at":"2023-08-25T17:30:08Z","title":"Joint Modeling of Feature, Correspondence, and a Compressed Memory for Video Object Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13505","snapshot_observed_at":"2026-07-11T23:56:52.009530Z","title":"Joint mod- eling of feature, correspondence, and a compressed memory for video object segmentation.arXiv preprint arXiv:2308.13505,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03789","last_updated":"2026-07-04T09:32:13Z","snapshot_observed_at":"2026-08-08T01:59:20.644759Z","submitted_at":"2026-07-04T09:32:13Z","title":"G$^2$TAM: Geometry Grounded Track Anything Model","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-11T23:56:52.009530Z"},"links":{"cited_paper":"/paper/2308.13505","citing_paper":"/paper/2607.03789"},"observation_digest":"sha256:9dfeafde48c846c96d33c8b53e118b7f2ce9424c099b123ef664fa848579d614","observation_id":"f933e600-46e6-4317-af23-4d2d5d8dd5c5","resolution":{"observed_at":"2026-07-11T23:56:52.009530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03825","last_updated":"2025-05-08T08:32:16Z","snapshot_observed_at":"2026-07-06T19:28:08.374354Z","submitted_at":"2024-10-04T18:00:07Z","title":"MonST3R: A Simple Approach for Estimating Geometry in the Presence of Motion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03825","snapshot_observed_at":"2026-07-11T23:56:52.009530Z","title":"Monst3r: A simple ap- proach for estimating geometry in the presence of motion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03789","last_updated":"2026-07-04T09:32:13Z","snapshot_observed_at":"2026-08-08T01:59:20.644759Z","submitted_at":"2026-07-04T09:32:13Z","title":"G$^2$TAM: Geometry Grounded Track Anything Model","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-11T23:56:52.009530Z"},"links":{"cited_paper":"/paper/2410.03825","citing_paper":"/paper/2607.03789"},"observation_digest":"sha256:7bdc58cc19ffe7182cc95bc2743ab61f970add7b4a3a43e10e49d0f1f0485259","observation_id":"e5df747a-f828-44c5-9865-3d7c4dfcaadf","resolution":{"observed_at":"2026-07-11T23:56:52.009530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:56:52.009530Z","title":"From flatland to space: Teaching vision-language models to per- ceive and reason in 3d.arXiv preprint arXiv:2503.22976, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03789","last_updated":"2026-07-04T09:32:13Z","snapshot_observed_at":"2026-08-08T01:59:20.644759Z","submitted_at":"2026-07-04T09:32:13Z","title":"G$^2$TAM: Geometry Grounded Track Anything Model","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T23:56:52.009530Z"},"links":{"citing_paper":"/paper/2607.03789"},"observation_digest":"sha256:02562e15d4c233d999c44fe33ac41a0b37d3a70928e32b3e8266f2c121f3f207","observation_id":"13c9f45b-6c4b-4d20-9950-981ed7ff8ed9","resolution":{"observed_at":"2026-07-11T23:56:52.009530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:56:52.009530Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03789","last_updated":"2026-07-04T09:32:13Z","snapshot_observed_at":"2026-08-08T01:59:20.644759Z","submitted_at":"2026-07-04T09:32:13Z","title":"G$^2$TAM: Geometry Grounded Track Anything Model","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-11T23:56:52.009530Z"},"links":{"citing_paper":"/paper/2607.03789"},"observation_digest":"sha256:d36e135b6982a256e591a520019848047c9c4814ff8b376cb7d230993c35e09b","observation_id":"d64eb363-7dfc-4c76-934f-fd8a2a3b4655","resolution":{"observed_at":"2026-07-11T23:56:52.009530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:56:52.009530Z","title":"To stabilize optimization, the data sampler ensures that each mini-batch contains only one data type","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03789","last_updated":"2026-07-04T09:32:13Z","snapshot_observed_at":"2026-08-08T01:59:20.644759Z","submitted_at":"2026-07-04T09:32:13Z","title":"G$^2$TAM: Geometry Grounded Track Anything Model","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-11T23:56:52.009530Z"},"links":{"citing_paper":"/paper/2607.03789"},"observation_digest":"sha256:453b2bf6738dcf9971820df4c93849d3344acbc020ce8f62ff57df1d54d6a1ac","observation_id":"e85a35b5-d17e-4736-b174-9ade2e382db5","resolution":{"observed_at":"2026-07-11T23:56:52.009530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:56:52.009530Z","title":"the keyboard closer to the window","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03789","last_updated":"2026-07-04T09:32:13Z","snapshot_observed_at":"2026-08-08T01:59:20.644759Z","submitted_at":"2026-07-04T09:32:13Z","title":"G$^2$TAM: Geometry Grounded Track Anything Model","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-11T23:56:52.009530Z"},"links":{"citing_paper":"/paper/2607.03789"},"observation_digest":"sha256:6b47ca04e3fa768e2dd6050b2200f66ec40328538402d4ccefdd73e40286d894","observation_id":"82767fa5-f7b7-44b9-9325-40b453c9951e","resolution":{"observed_at":"2026-07-11T23:56:52.009530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.03789","last_updated":"2026-07-04T09:32:13Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T01:59:20.644759Z","submitted_at":"2026-07-04T09:32:13Z","title":"G$^2$TAM: Geometry Grounded Track Anything Model"},"reference_resolution":{"displayed":18,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":18},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 18 of 18 outbound references and 0 inbound Pith citation observations for arXiv:2607.03789."}