{"as_of":"2026-08-19T01:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:723114c2589007e95470da900149d49bb979f6aa85328bc45e12bd2db3d2dd90","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T19:31:31.102375Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.00315/citation-record","integrity":"/paper/2502.00315/integrity","json":"/paper/2502.00315/citation-record.json","paper":"/paper/2502.00315"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:31:30.976969Z","title":"End-to-end object detection with transformers,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.00315","last_updated":"2025-02-01T04:37:13Z","snapshot_observed_at":"2026-08-15T15:09:42.242873Z","submitted_at":"2025-02-01T04:37:13Z","title":"MonoDINO-DETR: Depth-Enhanced Monocular 3D Object Detection Using a Vision Foundation Model","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T19:31:30.976969Z"},"links":{"citing_paper":"/paper/2502.00315"},"observation_digest":"sha256:468c6571a4d44d829eba46ad0e3257f8563c8175397ca97631950148e54edd68","observation_id":"bed1f976-57f5-4e54-b0ac-5fa3b0dc6524","resolution":{"observed_at":"2026-08-09T19:31:30.976969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-17T13:03:40.359628Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-09T19:31:30.981969Z","title":"Dinov2: Learning robust visual features without supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00315","last_updated":"2025-02-01T04:37:13Z","snapshot_observed_at":"2026-08-15T15:09:42.242873Z","submitted_at":"2025-02-01T04:37:13Z","title":"MonoDINO-DETR: Depth-Enhanced Monocular 3D Object Detection Using a Vision Foundation Model","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-09T19:31:30.981969Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2502.00315"},"observation_digest":"sha256:407e8646a1c19cadbbbb5d3e21f821d9d4de71b79bf2df5851d0e618be002326","observation_id":"4b732942-871c-4476-9b64-9e301774c6f3","resolution":{"observed_at":"2026-08-09T19:31:30.981969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-09T19:31:30.986976Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.00315","last_updated":"2025-02-01T04:37:13Z","snapshot_observed_at":"2026-08-15T15:09:42.242873Z","submitted_at":"2025-02-01T04:37:13Z","title":"MonoDINO-DETR: Depth-Enhanced Monocular 3D Object Detection Using a Vision Foundation Model","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-09T19:31:30.986976Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2502.00315"},"observation_digest":"sha256:90a8ed4d642519763ea0ad854946d0f91e1a8e2a0b0b3c201e0788fb36d8263d","observation_id":"4dea1a48-eefa-4d19-b17e-e1c2589b192b","resolution":{"observed_at":"2026-08-09T19:31:30.986976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:31:30.991683Z","title":"Are we ready for autonomous driving? the kitti vision benchmark suite,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2502.00315","last_updated":"2025-02-01T04:37:13Z","snapshot_observed_at":"2026-08-15T15:09:42.242873Z","submitted_at":"2025-02-01T04:37:13Z","title":"MonoDINO-DETR: Depth-Enhanced Monocular 3D Object Detection Using a Vision Foundation Model","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-09T19:31:30.991683Z"},"links":{"citing_paper":"/paper/2502.00315"},"observation_digest":"sha256:72cd139eb190d9c75d93d918d245802d8d64ed6fdaed1edcbea7e945dbfbeb20","observation_id":"10917a14-f113-4d39-8933-0fb5fc917e3e","resolution":{"observed_at":"2026-08-09T19:31:30.991683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:31:31.384864Z","title":"M3d-rpn: Monocular 3d region proposal network for object detection,","venue":null,"work_id":"f8f0085e-ded9-453e-8965-12b634919c15","year":2019},"citing_paper":{"arxiv_id":"2502.00315","last_updated":"2025-02-01T04:37:13Z","snapshot_observed_at":"2026-08-15T15:09:42.242873Z","submitted_at":"2025-02-01T04:37:13Z","title":"MonoDINO-DETR: Depth-Enhanced Monocular 3D Object Detection Using a Vision Foundation Model","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-09T19:31:30.996493Z"},"links":{"citing_paper":"/paper/2502.00315"},"observation_digest":"sha256:f8f28b50ad9277f288644eea9197f212f505bd0d2e54f0a1e0da4c66ae9674cc","observation_id":"c65bb62f-ce24-4738-9e2c-9eea9cbc2ceb","resolution":{"observed_at":"2026-08-09T19:31:31.388988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:31:31.373378Z","title":"Monoground: Detecting monocular 3d objects from the ground,","venue":null,"work_id":"831bea44-9295-48d8-80ef-18d8be65fe4f","year":2022},"citing_paper":{"arxiv_id":"2502.00315","last_updated":"2025-02-01T04:37:13Z","snapshot_observed_at":"2026-08-15T15:09:42.242873Z","submitted_at":"2025-02-01T04:37:13Z","title":"MonoDINO-DETR: Depth-Enhanced Monocular 3D Object Detection Using a Vision Foundation Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-09T19:31:31.001069Z"},"links":{"citing_paper":"/paper/2502.00315"},"observation_digest":"sha256:4daed9b49169c1bac32d679564c111faafb677f482de120692edd88feb848bd2","observation_id":"82eda0e6-428a-4d70-80f4-b1df7c381aa2","resolution":{"observed_at":"2026-08-09T19:31:31.377598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:31:31.361401Z","title":"Learning depth-guided convolutions for monocular 3d object detection,","venue":null,"work_id":"ad3cc3bc-0072-4a4b-82a7-90ca514b0bb4","year":2020},"citing_paper":{"arxiv_id":"2502.00315","last_updated":"2025-02-01T04:37:13Z","snapshot_observed_at":"2026-08-15T15:09:42.242873Z","submitted_at":"2025-02-01T04:37:13Z","title":"MonoDINO-DETR: Depth-Enhanced Monocular 3D Object Detection Using a Vision Foundation Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T19:31:31.005683Z"},"links":{"citing_paper":"/paper/2502.00315"},"observation_digest":"sha256:1db2bd15f485074fe1cff37c8d8c05eba0e7354b54a9732833f4fa9eeb4b3617","observation_id":"aca53789-8481-48d0-a066-c83314f7b3f8","resolution":{"observed_at":"2026-08-09T19:31:31.365700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:31:31.349611Z","title":"Depth-conditioned dynamic message propagation for monocular 3d object detection,","venue":null,"work_id":"b8bbe9cf-34a7-4c4f-b210-bfb7137aaf47","year":2021},"citing_paper":{"arxiv_id":"2502.00315","last_updated":"2025-02-01T04:37:13Z","snapshot_observed_at":"2026-08-15T15:09:42.242873Z","submitted_at":"2025-02-01T04:37:13Z","title":"MonoDINO-DETR: Depth-Enhanced Monocular 3D Object Detection Using a Vision Foundation Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T19:31:31.009879Z"},"links":{"citing_paper":"/paper/2502.00315"},"observation_digest":"sha256:73a8dda22d61e38533fcc3ba82779d7a358aa912b394cafb5c031bc65a8a62ed","observation_id":"3437aa88-650c-4116-a8a7-5bfcaaa352bc","resolution":{"observed_at":"2026-08-09T19:31:31.353816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:31:31.337593Z","title":"Monodtr: Monocular 3d object detection with depth-aware transformer,","venue":null,"work_id":"024fcc9f-962c-470a-8997-7d7424f0d12c","year":2022},"citing_paper":{"arxiv_id":"2502.00315","last_updated":"2025-02-01T04:37:13Z","snapshot_observed_at":"2026-08-15T15:09:42.242873Z","submitted_at":"2025-02-01T04:37:13Z","title":"MonoDINO-DETR: Depth-Enhanced Monocular 3D Object Detection Using a Vision Foundation Model","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T19:31:31.013791Z"},"links":{"citing_paper":"/paper/2502.00315"},"observation_digest":"sha256:2d776a01aba3edf8060b8c36e37217351db1acb8a0c482e4b8ad3d1a808a2e69","observation_id":"272c1ee1-e289-4de9-9871-462c06f09fc2","resolution":{"observed_at":"2026-08-09T19:31:31.341878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:31:31.017762Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.00315","last_updated":"2025-02-01T04:37:13Z","snapshot_observed_at":"2026-08-15T15:09:42.242873Z","submitted_at":"2025-02-01T04:37:13Z","title":"MonoDINO-DETR: Depth-Enhanced Monocular 3D Object Detection Using a Vision Foundation Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T19:31:31.017762Z"},"links":{"citing_paper":"/paper/2502.00315"},"observation_digest":"sha256:e936941620bb63e4a274e9f79d68be5dea55bfc0c66022f496b584dbf02035b6","observation_id":"cb1e1a59-bfe5-44f2-8dd1-584760d1066f","resolution":{"observed_at":"2026-08-09T19:31:31.017762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:31:31.022022Z","title":"Monodetr: Depth-guided transformer for monocular 3d object detection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00315","last_updated":"2025-02-01T04:37:13Z","snapshot_observed_at":"2026-08-15T15:09:42.242873Z","submitted_at":"2025-02-01T04:37:13Z","title":"MonoDINO-DETR: Depth-Enhanced Monocular 3D Object Detection Using a Vision Foundation Model","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T19:31:31.022022Z"},"links":{"citing_paper":"/paper/2502.00315"},"observation_digest":"sha256:b2e4b44ec693de6bc932be50d7cbb2c267365d220f4103faacf30c78614bd674","observation_id":"77a3cd74-ae80-4166-803f-cc0f54496e6b","resolution":{"observed_at":"2026-08-09T19:31:31.022022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:31:31.313472Z","title":"Categorical depth distribution network for monocular 3d object detection,","venue":null,"work_id":"8b85279e-9a97-4fea-9c89-621050d647bd","year":2021},"citing_paper":{"arxiv_id":"2502.00315","last_updated":"2025-02-01T04:37:13Z","snapshot_observed_at":"2026-08-15T15:09:42.242873Z","submitted_at":"2025-02-01T04:37:13Z","title":"MonoDINO-DETR: Depth-Enhanced Monocular 3D Object Detection Using a Vision Foundation Model","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T19:31:31.026157Z"},"links":{"citing_paper":"/paper/2502.00315"},"observation_digest":"sha256:16145f88f2d42c151630c5eda19ffc8243b076e937f6e772f906348f5b8c2c1a","observation_id":"cccc173d-03da-4794-b5da-b3dbae5b03ad","resolution":{"observed_at":"2026-08-09T19:31:31.317711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12329","last_updated":"2022-03-30T16:04:38Z","snapshot_observed_at":"2026-08-16T17:25:09.013446Z","submitted_at":"2022-01-28T18:51:09Z","title":"DAB-DETR: Dynamic Anchor Boxes are Better Queries for DETR","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12329","snapshot_observed_at":"2026-08-09T19:31:31.030457Z","title":"Dab-detr: Dynamic anchor boxes are better queries for detr,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00315","last_updated":"2025-02-01T04:37:13Z","snapshot_observed_at":"2026-08-15T15:09:42.242873Z","submitted_at":"2025-02-01T04:37:13Z","title":"MonoDINO-DETR: Depth-Enhanced Monocular 3D Object Detection Using a Vision Foundation Model","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T19:31:31.030457Z"},"links":{"cited_paper":"/paper/2201.12329","citing_paper":"/paper/2502.00315"},"observation_digest":"sha256:fe782d38b05820e11ec09eaa474f743abe1775efa0852f84bc2d6c74f7342bec","observation_id":"9c343dde-a08f-4c9e-bd91-026d1e33701b","resolution":{"observed_at":"2026-08-09T19:31:31.030457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:31:31.034721Z","title":"Imagenet large scale visual recognition challenge,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.00315","last_updated":"2025-02-01T04:37:13Z","snapshot_observed_at":"2026-08-15T15:09:42.242873Z","submitted_at":"2025-02-01T04:37:13Z","title":"MonoDINO-DETR: Depth-Enhanced Monocular 3D Object Detection Using a Vision Foundation Model","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T19:31:31.034721Z"},"links":{"citing_paper":"/paper/2502.00315"},"observation_digest":"sha256:ff5c22627d9538e8f3bdf20c6096da1dc6365e978951231dec7a9a4478d7305d","observation_id":"485d70ca-785e-49a2-a547-5c337b3d542d","resolution":{"observed_at":"2026-08-09T19:31:31.034721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:31:31.038576Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.00315","last_updated":"2025-02-01T04:37:13Z","snapshot_observed_at":"2026-08-15T15:09:42.242873Z","submitted_at":"2025-02-01T04:37:13Z","title":"MonoDINO-DETR: Depth-Enhanced Monocular 3D Object Detection Using a Vision Foundation Model","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T19:31:31.038576Z"},"links":{"citing_paper":"/paper/2502.00315"},"observation_digest":"sha256:bb2415d586bd479d11c841275e28ce825232d3da60461ab6c7da1f6aaae77841","observation_id":"a0f668ea-58f2-4097-884b-10dea2846927","resolution":{"observed_at":"2026-08-09T19:31:31.038576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:31:31.042213Z","title":"Densely connected convolutional networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.00315","last_updated":"2025-02-01T04:37:13Z","snapshot_observed_at":"2026-08-15T15:09:42.242873Z","submitted_at":"2025-02-01T04:37:13Z","title":"MonoDINO-DETR: Depth-Enhanced Monocular 3D Object Detection Using a Vision Foundation Model","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T19:31:31.042213Z"},"links":{"citing_paper":"/paper/2502.00315"},"observation_digest":"sha256:39b2764a78f934a6724e42ffe7976169ad2bff782dddfe068fcabd0bd84cfd5d","observation_id":"e494b68f-819b-4af7-ad74-37ea4500769f","resolution":{"observed_at":"2026-08-09T19:31:31.042213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:31:31.282674Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"2163c448-55ec-4f69-8880-ef37fa496e87","year":2021},"citing_paper":{"arxiv_id":"2502.00315","last_updated":"2025-02-01T04:37:13Z","snapshot_observed_at":"2026-08-15T15:09:42.242873Z","submitted_at":"2025-02-01T04:37:13Z","title":"MonoDINO-DETR: Depth-Enhanced Monocular 3D Object Detection Using a Vision Foundation Model","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T19:31:31.046029Z"},"links":{"citing_paper":"/paper/2502.00315"},"observation_digest":"sha256:02c2dec83309e19103118485e2eecf07cf84398e8abaebcc683b278220de2d8e","observation_id":"7373efe4-d0b2-49f4-b0b6-6fc2da84a9f7","resolution":{"observed_at":"2026-08-09T19:31:31.286749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:31:31.049816Z","title":"Emerging properties in self-supervised vision trans- formers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00315","last_updated":"2025-02-01T04:37:13Z","snapshot_observed_at":"2026-08-15T15:09:42.242873Z","submitted_at":"2025-02-01T04:37:13Z","title":"MonoDINO-DETR: Depth-Enhanced Monocular 3D Object Detection Using a Vision Foundation Model","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T19:31:31.049816Z"},"links":{"citing_paper":"/paper/2502.00315"},"observation_digest":"sha256:56149a654186a6fd92ccd9ec71f692fb92ba308b9b2d529cfa16ec9f3d38ddf8","observation_id":"00e4e725-5c41-4f57-acd6-6dfb80815a91","resolution":{"observed_at":"2026-08-09T19:31:31.049816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:31:31.053705Z","title":"Segment anything,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00315","last_updated":"2025-02-01T04:37:13Z","snapshot_observed_at":"2026-08-15T15:09:42.242873Z","submitted_at":"2025-02-01T04:37:13Z","title":"MonoDINO-DETR: Depth-Enhanced Monocular 3D Object Detection Using a Vision Foundation Model","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T19:31:31.053705Z"},"links":{"citing_paper":"/paper/2502.00315"},"observation_digest":"sha256:f9bf67d6e4216f77733990b1ace16a1569bd6afe3aa3392026c0aaf1f42fa126","observation_id":"d8ea01d6-1c1b-427e-9743-6cf90377bc62","resolution":{"observed_at":"2026-08-09T19:31:31.053705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:31:31.057770Z","title":"Vision transformers for dense prediction,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00315","last_updated":"2025-02-01T04:37:13Z","snapshot_observed_at":"2026-08-15T15:09:42.242873Z","submitted_at":"2025-02-01T04:37:13Z","title":"MonoDINO-DETR: Depth-Enhanced Monocular 3D Object Detection Using a Vision Foundation Model","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T19:31:31.057770Z"},"links":{"citing_paper":"/paper/2502.00315"},"observation_digest":"sha256:919fa9070c2c72051079829d309a24fa57b8fb182f411a859914bebd6e47b2ce","observation_id":"1ec96f7f-899f-4b2d-8c78-e528335d04b6","resolution":{"observed_at":"2026-08-09T19:31:31.057770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09414","last_updated":"2024-10-20T11:24:09Z","snapshot_observed_at":"2026-07-06T18:30:32.982860Z","submitted_at":"2024-06-13T17:59:56Z","title":"Depth Anything V2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09414","snapshot_observed_at":"2026-08-09T19:31:31.061883Z","title":"Depth anything v2,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00315","last_updated":"2025-02-01T04:37:13Z","snapshot_observed_at":"2026-08-15T15:09:42.242873Z","submitted_at":"2025-02-01T04:37:13Z","title":"MonoDINO-DETR: Depth-Enhanced Monocular 3D Object Detection Using a Vision Foundation Model","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T19:31:31.061883Z"},"links":{"cited_paper":"/paper/2406.09414","citing_paper":"/paper/2502.00315"},"observation_digest":"sha256:f6bd67b6af5dbbf9e3173fe810417f577b458bfe4cf41fc06f47fa8cedca6c27","observation_id":"8ce98e72-ffb9-4259-af55-a93dabc4c0cb","resolution":{"observed_at":"2026-08-09T19:31:31.061883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:31:31.252373Z","title":"Refinenet: Multi-path refinement networks for high-resolution semantic segmentation,","venue":null,"work_id":"219dd6bc-f37d-49e4-8bba-bb5d20e1810c","year":2017},"citing_paper":{"arxiv_id":"2502.00315","last_updated":"2025-02-01T04:37:13Z","snapshot_observed_at":"2026-08-15T15:09:42.242873Z","submitted_at":"2025-02-01T04:37:13Z","title":"MonoDINO-DETR: Depth-Enhanced Monocular 3D Object Detection Using a Vision Foundation Model","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T19:31:31.066194Z"},"links":{"citing_paper":"/paper/2502.00315"},"observation_digest":"sha256:6e8de0a325fd98f916c14800113c2b74726dee7b30a871a2ddb7d7fd22b2253d","observation_id":"46d61109-cab3-4bd7-b7a5-45cd8980bac3","resolution":{"observed_at":"2026-08-09T19:31:31.256730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:31:31.240499Z","title":"Monoc- ular relative depth perception with web stereo data supervision,","venue":null,"work_id":"efdc0589-0b81-4a46-b4e0-e223340b1fcf","year":2018},"citing_paper":{"arxiv_id":"2502.00315","last_updated":"2025-02-01T04:37:13Z","snapshot_observed_at":"2026-08-15T15:09:42.242873Z","submitted_at":"2025-02-01T04:37:13Z","title":"MonoDINO-DETR: Depth-Enhanced Monocular 3D Object Detection Using a Vision Foundation Model","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T19:31:31.069951Z"},"links":{"citing_paper":"/paper/2502.00315"},"observation_digest":"sha256:1811222947a9bab60cb1c8f248272da1734dfdca5707d7a6327bc01a40ca577f","observation_id":"76b3c28e-44fa-441e-b38c-9d8a9f0033f4","resolution":{"observed_at":"2026-08-09T19:31:31.244627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.02002","last_updated":"2018-02-07T18:44:44Z","snapshot_observed_at":"2026-08-17T00:09:26.216715Z","submitted_at":"2017-08-07T06:32:42Z","title":"Focal Loss for Dense Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.02002","snapshot_observed_at":"2026-08-09T19:31:31.073657Z","title":"Focal loss for dense object detection,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.00315","last_updated":"2025-02-01T04:37:13Z","snapshot_observed_at":"2026-08-15T15:09:42.242873Z","submitted_at":"2025-02-01T04:37:13Z","title":"MonoDINO-DETR: Depth-Enhanced Monocular 3D Object Detection Using a Vision Foundation Model","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T19:31:31.073657Z"},"links":{"cited_paper":"/paper/1708.02002","citing_paper":"/paper/2502.00315"},"observation_digest":"sha256:643d571ab0665ca872cb40798d3e759c90dc1b4599cda88edb06713eacc864f1","observation_id":"5d80ccc5-d6ff-4bfa-b84d-75203e023cb6","resolution":{"observed_at":"2026-08-09T19:31:31.073657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:31:31.077756Z","title":"The hungarian method for the assignment problem,","venue":null,"work_id":null,"year":1955},"citing_paper":{"arxiv_id":"2502.00315","last_updated":"2025-02-01T04:37:13Z","snapshot_observed_at":"2026-08-15T15:09:42.242873Z","submitted_at":"2025-02-01T04:37:13Z","title":"MonoDINO-DETR: Depth-Enhanced Monocular 3D Object Detection Using a Vision Foundation Model","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T19:31:31.077756Z"},"links":{"citing_paper":"/paper/2502.00315"},"observation_digest":"sha256:d3462b7f3d6a7eeb768385726c4e8e51328fadf854c753cfa1a22c9767ab7325","observation_id":"86c4e57b-422d-46fa-bc87-2c4159f47c8a","resolution":{"observed_at":"2026-08-09T19:31:31.077756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:31:31.222594Z","title":"3d object proposals for accurate object class detection,","venue":null,"work_id":"d61b90a3-7171-408a-a1be-9d335b65dbe7","year":2015},"citing_paper":{"arxiv_id":"2502.00315","last_updated":"2025-02-01T04:37:13Z","snapshot_observed_at":"2026-08-15T15:09:42.242873Z","submitted_at":"2025-02-01T04:37:13Z","title":"MonoDINO-DETR: Depth-Enhanced Monocular 3D Object Detection Using a Vision Foundation Model","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T19:31:31.081368Z"},"links":{"citing_paper":"/paper/2502.00315"},"observation_digest":"sha256:bf6321731bfa394a2c009af2d55bb818bb47876ab8dca5728e533a754a9583d6","observation_id":"122b9143-22c5-4bd7-a714-162ce1bef421","resolution":{"observed_at":"2026-08-09T19:31:31.227176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:31:31.211328Z","title":"Monocular 3d object detection for autonomous driving,","venue":null,"work_id":"8a0f9e7b-6652-421f-94d2-19d0752e293f","year":2016},"citing_paper":{"arxiv_id":"2502.00315","last_updated":"2025-02-01T04:37:13Z","snapshot_observed_at":"2026-08-15T15:09:42.242873Z","submitted_at":"2025-02-01T04:37:13Z","title":"MonoDINO-DETR: Depth-Enhanced Monocular 3D Object Detection Using a Vision Foundation Model","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-09T19:31:31.085174Z"},"links":{"citing_paper":"/paper/2502.00315"},"observation_digest":"sha256:1275e43af1294f89c2a09280e5f73ac1884707fe1da6c3f76a57e734c72a63d9","observation_id":"6ef8a58f-db10-4a32-bf9f-7b1f90652640","resolution":{"observed_at":"2026-08-09T19:31:31.215461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:31:31.089008Z","title":"Pointpillars: Fast encoders for object detection from point clouds,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.00315","last_updated":"2025-02-01T04:37:13Z","snapshot_observed_at":"2026-08-15T15:09:42.242873Z","submitted_at":"2025-02-01T04:37:13Z","title":"MonoDINO-DETR: Depth-Enhanced Monocular 3D Object Detection Using a Vision Foundation Model","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T19:31:31.089008Z"},"links":{"citing_paper":"/paper/2502.00315"},"observation_digest":"sha256:436baca26eef6f4d5fa18282876806c133a1b9c0716d4d176204dd2d7821be73","observation_id":"968360c5-676b-4953-9585-43426a7e3494","resolution":{"observed_at":"2026-08-09T19:31:31.089008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-09T19:31:31.093261Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.00315","last_updated":"2025-02-01T04:37:13Z","snapshot_observed_at":"2026-08-15T15:09:42.242873Z","submitted_at":"2025-02-01T04:37:13Z","title":"MonoDINO-DETR: Depth-Enhanced Monocular 3D Object Detection Using a Vision Foundation Model","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-09T19:31:31.093261Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2502.00315"},"observation_digest":"sha256:4e0daea827358871315e92fd242678fe832f59d6735af845a0113a2b81ec1f9c","observation_id":"9e345235-89ab-4ed0-b448-2aa6445d5a8a","resolution":{"observed_at":"2026-08-09T19:31:31.093261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:31:31.192241Z","title":"Monocd: Monocular 3d object detection with complementary depths,","venue":null,"work_id":"8990c95e-8ebd-477b-9640-307c68a61269","year":2024},"citing_paper":{"arxiv_id":"2502.00315","last_updated":"2025-02-01T04:37:13Z","snapshot_observed_at":"2026-08-15T15:09:42.242873Z","submitted_at":"2025-02-01T04:37:13Z","title":"MonoDINO-DETR: Depth-Enhanced Monocular 3D Object Detection Using a Vision Foundation Model","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-09T19:31:31.098436Z"},"links":{"citing_paper":"/paper/2502.00315"},"observation_digest":"sha256:bfc81f855a19cf3eb40b866413bf3f9e14875fa9579d0712e998502d52737396","observation_id":"32d08526-4a72-4a6e-bd85-ae4fcbe81627","resolution":{"observed_at":"2026-08-09T19:31:31.197896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:31:31.102375Z","title":"Exploring plain vision transformer backbones for object detection,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00315","last_updated":"2025-02-01T04:37:13Z","snapshot_observed_at":"2026-08-15T15:09:42.242873Z","submitted_at":"2025-02-01T04:37:13Z","title":"MonoDINO-DETR: Depth-Enhanced Monocular 3D Object Detection Using a Vision Foundation Model","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-09T19:31:31.102375Z"},"links":{"citing_paper":"/paper/2502.00315"},"observation_digest":"sha256:31e9cc60e5bf7f0be9f4b70d36840d9a8d5fb6c59018a532570f39efb6edbb65","observation_id":"de0cbbef-af7e-4975-8d14-1a566af763f6","resolution":{"observed_at":"2026-08-09T19:31:31.102375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.00315","last_updated":"2025-02-01T04:37:13Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T15:09:42.242873Z","submitted_at":"2025-02-01T04:37:13Z","title":"MonoDINO-DETR: Depth-Enhanced Monocular 3D Object Detection Using a Vision Foundation Model"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":12},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2502.00315."}