{"as_of":"2026-08-10T20:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d4f1ce4401bbebbbffa6defb7b6acc63bf2286ffa55c5c782e1be79e2fc2132e","coverage":[{"denominator":77,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":77,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:26:05.840078Z","state":"measured"},{"denominator":78,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":78,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T14:05:11.464538Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T14:05:13.465208Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"cited_work":{"arxiv_id":"2505.21868","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.21868","snapshot_observed_at":"2026-08-06T14:05:13.465208Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","venue":"cs.CV","work_id":"d11e49b8-0da5-4bff-a400-1142edd768aa","year":2025},"citing_paper":{"arxiv_id":"2507.19807","last_updated":"2025-07-26T05:40:04Z","snapshot_observed_at":"2026-08-06T14:05:07.696551Z","submitted_at":"2025-07-26T05:40:04Z","title":"DS-Det: Single-Query Paradigm and Attention Disentangled Learning for Flexible Object Detection","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T14:05:11.464538Z"},"links":{"cited_paper":"/paper/2505.21868","citing_paper":"/paper/2507.19807"},"observation_digest":"sha256:c32c374d1d1f821ad2d0a30ec0e4807320709d094a6216efec7b347f0a3c56ba","observation_id":"f32838b5-3997-45a6-9cd8-1aaedd938515","resolution":{"observed_at":"2026-08-06T14:05:13.512383Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.21868/citation-record","integrity":"/paper/2505.21868/integrity","json":"/paper/2505.21868/citation-record.json","paper":"/paper/2505.21868"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:19.343517Z","title":"A full data augmentation pipeline for small object detection based on generative adversarial networks","venue":null,"work_id":"2b022926-4b21-49a0-bd13-505ceb83c132","year":2023},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:58.279951Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:2877afcb40c76956a02550c2c3e0a74c55cf0e9fb0906eebd4ee3377a6124d39","observation_id":"4944cc5f-aea2-44e5-a2f2-e7061cdb0e09","resolution":{"observed_at":"2026-08-07T13:26:19.474303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:19.153389Z","title":"Cascade r-cnn: Delving into high quality object detection","venue":null,"work_id":"02129e2c-006a-41a2-abc9-90971c7d3a4a","year":2018},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:58.336063Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:b4dd5eb5956c7350ffb60172211f475da72600127bc47df00dbed8a400b69116","observation_id":"afb68c42-8dbd-4db6-96e1-7dd22111af0e","resolution":{"observed_at":"2026-08-07T13:26:19.233616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:18.934057Z","title":"Visible and clear: Finding tiny objects in difference map","venue":null,"work_id":"dd394d9f-f301-48f3-85c5-6cbaceca361c","year":2025},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:58.366759Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:2e149637dbda9608a3abe9f66d40ea584e6634fd1e2e96c49097ea525f95f571","observation_id":"ec11c3d1-c617-4b14-ac7a-8d4760b3826f","resolution":{"observed_at":"2026-08-07T13:26:19.038933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:18.819823Z","title":"Mlp-dino: Category modeling and query graphing with deep mlp for object detection","venue":null,"work_id":"5ff06586-806d-4fb5-ad8a-2f72c1452042","year":2024},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:58.432424Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:7632db9a1b3c90725c44ad358f5c48044e65abbfcd1c77987997615349ec41a9","observation_id":"463f7eab-ca82-4e01-81fd-4e503d9c85a3","resolution":{"observed_at":"2026-08-07T13:26:18.880275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:18.615565Z","title":"Strip-mlp: Efficient token interaction for vision mlp","venue":null,"work_id":"a1e05bb5-8f1c-49af-9ce9-9ff93051db3e","year":2023},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:58.511398Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:de587fb799aba49409bb25191d51806d2d4b5d2e6967d7e73d1ed66132af1191","observation_id":"8f0180ab-935a-4539-a1da-ba66a66f7648","resolution":{"observed_at":"2026-08-07T13:26:18.735238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:18.401358Z","title":"Cf-detr: Coarse-to- fine transformers for end-to-end object detection","venue":null,"work_id":"8e3bcdf8-384d-4dd6-99af-6d8a9986de1d","year":2022},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:58.553507Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:3b694f0d4bfa93f241338aaff0919b1aba89147c050d0da03bd66a38ef026aa4","observation_id":"bd3e59e4-9cfe-48d9-a77c-5420876d4a52","resolution":{"observed_at":"2026-08-07T13:26:18.493057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:25:58.649265Z","title":"End-to-end object detection with transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:58.649265Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:14650878ae1cebd5f5d5b7d736defbfe93b5662512bfdd1f7ae2511b5e3ba8de","observation_id":"0ecdf736-e652-4a6e-b9b5-ccc508a6a151","resolution":{"observed_at":"2026-08-07T13:25:58.649265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:25:58.772354Z","title":"Crossvit: Cross-attention multi-scale vision transformer for image classification","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:58.772354Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:f45fbe5e6c91687214e8241e247d7d289c12bfc774c128f09b4913bed7427501","observation_id":"2666daca-e839-4dd5-8e10-14a4d5ca518d","resolution":{"observed_at":"2026-08-07T13:25:58.772354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:18.117373Z","title":"Diffusiondet: Diffusion model for object detection","venue":null,"work_id":"938bca02-a4d6-4e16-a4c4-64ebcd5f8c0a","year":2023},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:58.842961Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:fecec493eaf2f7183cbd614df25252428a05ebcb21090a960a166004d28671ff","observation_id":"ed553674-038e-467f-b9fc-93cfe65af29f","resolution":{"observed_at":"2026-08-07T13:26:18.233277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:17.967547Z","title":"Towards large-scale small object detection: Survey and benchmarks","venue":null,"work_id":"e4462c31-7a52-4c4a-b22c-3b3eb7ac2c44","year":2023},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:58.895762Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:e47f09bdcdb11488b339b72c753f7e6b7c6b404f0522f3d21b1c51e49fa9e890","observation_id":"86ef30cb-55ee-422b-bde1-2ebf27482004","resolution":{"observed_at":"2026-08-07T13:26:18.030822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:17.750997Z","title":"Dynamic head: Unifying object detection heads with attentions","venue":null,"work_id":"9b26645e-4f41-4c5d-a28e-393f56280e16","year":2021},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:58.955162Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:efc98d9aedce3e236bf13082077d86fd4de88f227df0b66b336e6eb6a5604cce","observation_id":"2ce8076c-f1ad-4346-89b5-1356bc4eb03f","resolution":{"observed_at":"2026-08-07T13:26:17.842571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:25:59.026776Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:59.026776Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:e599ff9c83a223757cf1a343ecaac0623f2dee1d7e8fca86580ddb5711ad13a8","observation_id":"c3e44e5a-0232-42fe-944e-e1199ad4daf6","resolution":{"observed_at":"2026-08-07T13:25:59.026776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:17.467350Z","title":"Pedes- trian detection: An evaluation of the state of the art","venue":null,"work_id":"0dc8d08e-c84f-4380-84ae-91cf0972f318","year":2011},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:59.124745Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:4a44dcfefe88ccbd69adc7963fe1777b2fa9d2c6b81ed4464bb8905fe7b5ddda","observation_id":"17ce5735-f465-4841-a9e4-791aef58f6fa","resolution":{"observed_at":"2026-08-07T13:26:17.627036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:25:59.264408Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:59.264408Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:88b64b7694ceb3687803bbc8be70774a7017221b707a7ca7bd62b4e45f70f9bf","observation_id":"35ffc6d2-3518-44a8-b9ee-a47b80f2bf3c","resolution":{"observed_at":"2026-08-07T13:25:59.264408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:17.236530Z","title":"Centernet: Keypoint triplets for object detection","venue":null,"work_id":"f981e9e8-a654-4c47-a1cd-f6ad32c0e97b","year":2019},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:59.356532Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:be78b1809e61a64d5b68ce49554bde3227834c518b05e24fc50c4b989cc5c2ec","observation_id":"46d2306b-8858-4d4a-9bd6-ab17cb76fa0d","resolution":{"observed_at":"2026-08-07T13:26:17.316462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06659","last_updated":"2017-01-23T22:33:35Z","snapshot_observed_at":"2026-08-10T07:36:16.889189Z","submitted_at":"2017-01-23T22:33:35Z","title":"DSSD : Deconvolutional Single Shot Detector","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06659","snapshot_observed_at":"2026-08-07T13:25:59.407941Z","title":"Dssd: Deconvolutional single shot detector","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:59.407941Z"},"links":{"cited_paper":"/paper/1701.06659","citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:b67467354a3c4ed81cd12c7f53ade9a20ee06aaab5c555157a972e4c9965672d","observation_id":"9e4edb4e-b14b-4dcf-95fe-83b2146ccdc3","resolution":{"observed_at":"2026-08-07T13:25:59.407941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:16.942345Z","title":"Ps-rcnn: Detecting secondary human instances in a crowd via primary object suppression","venue":null,"work_id":"38bcad90-aa75-4ea5-89dc-bd3d97d94ad8","year":2020},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:59.456086Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:f52038fb5412bf7219e5cd6cd8264bf1d21953681bccb2295e19e1dbde7d4c56","observation_id":"dc512dc9-c16e-4989-b7e3-901a0b57f1cf","resolution":{"observed_at":"2026-08-07T13:26:17.115030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:16.660793Z","title":"Save the tiny, save the all: hierarchical activation network for tiny object detection","venue":null,"work_id":"20974a48-8c7e-4df4-8f17-b6940892cf24","year":2023},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:59.534745Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:55ba1048803bc7d396b7b12828af1e1b95b46ee1a8cbe74ddb54e8de8a68831f","observation_id":"f5a01355-036e-4aed-b728-9bb27e2fde2e","resolution":{"observed_at":"2026-08-07T13:26:16.800353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:16.439763Z","title":"Mask r-cnn","venue":null,"work_id":"3ffdd37b-cd7b-40dd-9bac-b36d4154d6e1","year":2017},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:59.574106Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:bad9f208e830c97e6d4660b60eccc5d72289972886150ebc313f9d17acaae105","observation_id":"68c74434-36e4-4171-8901-1e4adeb433d1","resolution":{"observed_at":"2026-08-07T13:26:16.548936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:25:59.694550Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:59.694550Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:f7eae520cb1cc5c82c935c03505229771fa484b36b687ea80a6ccdd5aa5e05f1","observation_id":"86eb835b-e8f0-4579-b9f3-762392ebed1e","resolution":{"observed_at":"2026-08-07T13:25:59.694550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:16.253938Z","title":"Multi- scale feature balance enhancement network for pedestrian detection","venue":null,"work_id":"2118f8c2-f0c9-4ce4-a41f-83220158626a","year":2022},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:59.775670Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:abaef32dd66a56a2727375d9ae547e5a333c4faddb00cebe5750ae39522f6b8c","observation_id":"a4cacb05-065f-4835-951e-f836fd18e0bb","resolution":{"observed_at":"2026-08-07T13:26:16.345005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-07-06T05:01:27.910364Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-07T13:25:59.906562Z","title":"Gaussian error linear units (gelus)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:59.906562Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:a439d98aa46badc512c92c648c73d385542a56d42edd001cb4882b884adc53ad","observation_id":"0c0ac9f7-3286-401b-bbea-d6d3b00d57e0","resolution":{"observed_at":"2026-08-07T13:25:59.906562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.04861","last_updated":"2017-04-17T03:57:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-04-17T03:57:34Z","title":"MobileNets: Efficient Convolutional Neural Networks for Mobile Vision Applications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.04861","snapshot_observed_at":"2026-08-07T13:25:59.983066Z","title":"Mobilenets: Efficient convolutional neural networks for mobile vision applications","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:59.983066Z"},"links":{"cited_paper":"/paper/1704.04861","citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:5e3a2bdc82a99f217227ca45f0a6acbdfa1576a5f67e7c9969fde0e776d3c51a","observation_id":"ea05ccca-44de-4828-a521-c9a391f01309","resolution":{"observed_at":"2026-08-07T13:25:59.983066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:16.032461Z","title":"Dq-detr: Detr with dynamic query for tiny object detection","venue":null,"work_id":"7df489b1-7a39-429c-abec-155ef7a72c56","year":2025},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:00.038393Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:eb2a0f7ede0c46e465a37797f81d5212b6d101d5ee816053220529ab534e0d48","observation_id":"a121ffc5-70f6-494a-a1b8-4ea654c6fbb7","resolution":{"observed_at":"2026-08-07T13:26:16.144449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:00.171622Z","title":"Detrs with hybrid matching","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:00.171622Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:7f99dd7d2a9e2b138cee84f919d2e0e03461892741bb71d23cf93a7a196e04c3","observation_id":"4de1dd05-adb2-4b73-87fe-d53605f0d79a","resolution":{"observed_at":"2026-08-07T13:26:00.171622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.07296","last_updated":"2019-02-19T21:47:31Z","snapshot_observed_at":"2026-07-06T07:34:10.374415Z","submitted_at":"2019-02-19T21:47:31Z","title":"Augmentation for small object detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.07296","snapshot_observed_at":"2026-08-07T13:26:00.311383Z","title":"Augmentation for small object detection","venue":null,"work_id":null,"year":1902},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:00.311383Z"},"links":{"cited_paper":"/paper/1902.07296","citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:eec871289f6a68d20d7caa3b6e2a641d7e8602f50e41ff47d339cf4239088ef9","observation_id":"02611a4c-c51c-4a96-a219-f699706d37e0","resolution":{"observed_at":"2026-08-07T13:26:00.311383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:15.744789Z","title":"Cornernet: Detecting objects as paired keypoints","venue":null,"work_id":"5b5c51a6-9cbb-4f07-aeee-d6bc794419d0","year":2018},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:00.433558Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:e84f74ddcc069890ade08951e5365bd76ff0987bc86c48103b7f98f4974b99e6","observation_id":"8e476865-0297-4efa-831c-80f9314f636b","resolution":{"observed_at":"2026-08-07T13:26:15.885046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:15.528736Z","title":"Dn-detr: Accelerate detr training by introducing query denoising","venue":null,"work_id":"14899379-a6a8-4209-8052-ec39903b8cc0","year":2022},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:00.513087Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:54c4610a6a0f852381fef60f63da276b0e76380a1164d4668815de441c7259be","observation_id":"dd6d6cb7-6c64-41d7-9878-a0fc0d759614","resolution":{"observed_at":"2026-08-07T13:26:15.620996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:15.358345Z","title":"Focal loss for dense object detection","venue":null,"work_id":"42e54259-fc78-4cb4-b7bc-053ea5ec8dcd","year":2017},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:00.558550Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:9c4c148042a5f9c3307c1bb089d8033344b884f98d85c2df769fbcd908a5951d","observation_id":"e9ee44e1-b4b8-4cf0-9adb-1dd40cd6d95d","resolution":{"observed_at":"2026-08-07T13:26:15.425305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:15.225426Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"ac566361-c5cd-4acd-80b4-e6b1b66bd381","year":2014},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:00.681928Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:faaaee69c72cf0c1fd43b0afdc92fe63f9848e99e8b8eee51fd3876661cfdb21","observation_id":"33b1f5fd-1430-447a-8b60-761ff4365664","resolution":{"observed_at":"2026-08-07T13:26:15.260871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:15.003683Z","title":"Are we ready for a new paradigm shift? a survey on visual deep mlp","venue":null,"work_id":"8d4d3cdc-6cbe-460f-867d-7c02808ac5d1","year":2022},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:00.781367Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:47c6e411dcbb472d3346b4c893b69e2b60222c7b13d5c2f8a87fab8348e15445","observation_id":"086066d8-e4ba-4dcf-84ef-7cf62d3bf65d","resolution":{"observed_at":"2026-08-07T13:26:15.114493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:14.849910Z","title":"Dab-detr: Dynamic anchor boxes are better queries for detr","venue":null,"work_id":"a172c7a5-428c-4c44-86e5-c0e4453f0f7a","year":2021},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:00.871812Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:35fe1b69a28fb9a148237d01d53f6636c14278b30099d284e2afc34aae4f98fa","observation_id":"3507ce27-0489-4fed-a95a-d0c7a5a0b63e","resolution":{"observed_at":"2026-08-07T13:26:14.934573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:14.682574Z","title":"Detection transformer with stable matching","venue":null,"work_id":"e136f7aa-d470-44c8-91d1-beba095541f2","year":2023},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:01.011227Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:845a895e16387163bc45eec7728f79fa7111fb9ff2fda3872b6918b0acea96b3","observation_id":"b1049426-0c5f-47bd-b0e9-dbc22467f5b5","resolution":{"observed_at":"2026-08-07T13:26:14.732272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-07T13:26:01.112722Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:01.112722Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:ff51a1f8d55da660ad3df838c4e3355072abb4810b945b7e9110ca6a674476c9","observation_id":"0a05d65b-5c04-4afd-b57d-5338add1622f","resolution":{"observed_at":"2026-08-07T13:26:01.112722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:14.468105Z","title":"Ssd: Single shot multibox detector","venue":null,"work_id":"71ec1fa9-c5f2-4c84-8142-d7be38de26e2","year":2016},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:01.203177Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:b5cf550b7cb40e56d753fa9b834a7bc7a76add215ca9945ba52c9311c36dddfc","observation_id":"5a275860-c211-43e2-85eb-4159c85a3440","resolution":{"observed_at":"2026-08-07T13:26:14.562258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:01.430602Z","title":"A survey and performance evaluation of deep learning methods for small object detection","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:01.430602Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:b057cc791e90aee5217d9e7ce0860e2b43bb100f056a05a4f682771dd33e365b","observation_id":"4cd54a29-b5ba-4914-a0e9-654b531ac21d","resolution":{"observed_at":"2026-08-07T13:26:01.430602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10166","last_updated":"2024-12-29T14:57:13Z","snapshot_observed_at":"2026-07-06T17:17:31.008185Z","submitted_at":"2024-01-18T17:55:39Z","title":"VMamba: Visual State Space Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10166","snapshot_observed_at":"2026-08-07T13:26:01.814883Z","title":"Vmamba: Visual state space model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:01.814883Z"},"links":{"cited_paper":"/paper/2401.10166","citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:45d879db72880e6d87d62cb2c12d636a30a6be743b3a0e28082f198d0f05d1ab","observation_id":"6fd72fcb-0d62-4855-b064-774681d03f52","resolution":{"observed_at":"2026-08-07T13:26:01.814883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:02.338021Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:02.338021Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:0cfa9aac65069f85db4e28780332a4075dca780152695543879b7e36136d0feb","observation_id":"8b5c8e19-40d7-445a-9120-bb19b36ad221","resolution":{"observed_at":"2026-08-07T13:26:02.338021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:03.203941Z","title":"A convnet for the 2020s","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:03.203941Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:64c22e1a7b7ab8ce4ab156c0d2ac71049c6b3fe193e5ef6fa9b3020a86ca3e3a","observation_id":"437a5d7f-c73a-46ad-89fd-3903dac566a6","resolution":{"observed_at":"2026-08-07T13:26:03.203941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:14.212518Z","title":"Decoupled weight decay regulariza- tion","venue":null,"work_id":"f9e375ec-b283-4954-b7af-683d9f8ec98d","year":2018},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:03.639813Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:61218d79a23c18bb2d17776c7da074559f90fe86da8d95f6d92f2385478425d1","observation_id":"80240d3b-aa59-49c9-9965-35ccf7c41b08","resolution":{"observed_at":"2026-08-07T13:26:14.288668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:14.003759Z","title":"Understand- ing the effective receptive field in deep convolutional neural networks","venue":null,"work_id":"f0a3e97c-fc55-40a7-a1fc-8e6ef4231190","year":2016},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:03.787755Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:4599bce114c98905506198969df47038e7f3c630a06f5008109175deb891c985","observation_id":"1c529d96-ea41-4ab4-9647-f8646bc8933a","resolution":{"observed_at":"2026-08-07T13:26:14.083722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:13.833580Z","title":"Cascade transformer decoder based occluded pedestrian detection with dynamic deformable convolution and gaussian projection channel atten- tion mechanism","venue":null,"work_id":"6b849cdd-b0d8-40ad-951e-e82dc740b5fa","year":2023},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:03.828773Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:6e6caa16f9fdad67e555cbfd68de2b4276f055c5794a1ff36ba4f76b60e6d303","observation_id":"1812a81c-f541-4dc2-a12a-648fade0f156","resolution":{"observed_at":"2026-08-07T13:26:13.919359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:13.639607Z","title":"Conditional detr for fast training convergence","venue":null,"work_id":"8f938c3f-3ca4-4ecd-a914-7b84b9ec06d8","year":2021},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:03.866886Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:ac2691f0d9a037b4c78b6913658f81c64ff277d832d903ca06e4e038137913b9","observation_id":"6da744e7-62e5-41ba-8607-de69b1e8f1e9","resolution":{"observed_at":"2026-08-07T13:26:13.733210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:13.429963Z","title":"Efficient featurized image pyramid network for single shot detector","venue":null,"work_id":"cbd658e6-f236-4066-81b5-3690115542b8","year":2019},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:03.903810Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:99b67a87df07650a6a1c65cabdb8ef32b632487e9aae59f05daff6c5f1bceb56","observation_id":"55cb8c0c-9f73-47c5-a4ef-08363df3c081","resolution":{"observed_at":"2026-08-07T13:26:13.537337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:13.205542Z","title":"Detectors: Detecting objects with recursive feature pyramid and switchable atrous convolu- tion","venue":null,"work_id":"d201ab9e-c206-47f3-88a1-1bff80b5a952","year":2021},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:03.936828Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:59e228c69da8777c407eed534fe1da8c76f171fe338fc95ce0811eafa25b3810","observation_id":"1d753599-2195-4c76-a4ef-70b9bb671d7a","resolution":{"observed_at":"2026-08-07T13:26:13.301575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:03.984819Z","title":"You only look once: Unified, real-time object detection","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:03.984819Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:13c4ae9e306e3af19e92eecd26a7da104ee9b298d74d0b7f9c78d46b937a104e","observation_id":"6934ca78-66e3-4c25-822d-94f454801c33","resolution":{"observed_at":"2026-08-07T13:26:03.984819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.04902","last_updated":"2023-09-10T00:08:29Z","snapshot_observed_at":"2026-08-10T09:48:48.265421Z","submitted_at":"2023-09-10T00:08:29Z","title":"Transformers in Small Object Detection: A Benchmark and Survey of State-of-the-Art","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.04902","snapshot_observed_at":"2026-08-07T13:26:04.069573Z","title":"Transformers in small object detection: A benchmark and survey of state-of-the-art","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:04.069573Z"},"links":{"cited_paper":"/paper/2309.04902","citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:7554ec68d5af1bb58ca31b03e179e0b18ce1c620c6bf3ca335f14ed946379dcd","observation_id":"d14a67f2-a017-43f6-8009-6c81586251a3","resolution":{"observed_at":"2026-08-07T13:26:04.069573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:04.129175Z","title":"Faster r- cnn: Towards real-time object detection with region proposal networks","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:04.129175Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:d9b7407eb80876848e32ca9af97544e56c0f3c8cc98dd9f0f10cd741761eba71","observation_id":"a03abf9c-5c8f-496d-9628-a690c13cddb6","resolution":{"observed_at":"2026-08-07T13:26:04.129175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07265","last_updated":"2023-06-13T17:53:15Z","snapshot_observed_at":"2026-07-06T15:41:39.660811Z","submitted_at":"2023-06-12T17:52:11Z","title":"detrex: Benchmarking Detection Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07265","snapshot_observed_at":"2026-08-07T13:26:04.195233Z","title":"detrex: Benchmarking detection transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:04.195233Z"},"links":{"cited_paper":"/paper/2306.07265","citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:b81022033d3d3fb503a6e4c66fa9392cb753f7e7c3fa2e3c6810482739f3dc77","observation_id":"e373f82e-4947-44b4-b896-dcf6318875be","resolution":{"observed_at":"2026-08-07T13:26:04.195233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:13.059647Z","title":"Sparse detr: Efficient end-to-end object detection with learnable sparsity","venue":null,"work_id":"45c4b420-a4d1-4ed7-91ce-5b315323a593","year":2021},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:04.230096Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:d5eb5c3c02b3e126ff67324d7c59b08c17b7f177704b24750f65a4e37dd3b923","observation_id":"b1a21bf5-5733-446e-8beb-06e5d66b5ae8","resolution":{"observed_at":"2026-08-07T13:26:13.110984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:12.824765Z","title":"Iterdet: iterative scheme for object detection in crowded environments","venue":null,"work_id":"8491a950-d405-48c3-bbcc-b54310db0f15","year":2020},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:04.283065Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:70b7aaea955d81c56d2612b1f2f5ddae3d2a426ead2b2cad167e3bf5cd1211eb","observation_id":"54fb2398-b496-471c-a8e6-fa542e544839","resolution":{"observed_at":"2026-08-07T13:26:12.949720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:12.634143Z","title":"Object detection in medical images based on hierarchical transformer and mask mechanism","venue":null,"work_id":"c2e40b5f-44a6-4bcb-86b6-f78f6a9cdd9d","year":2022},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:04.345012Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:d026624f80dc32fef6ef5de36b71628c00bb272a788d3c1f79a4beb4fcfcdc70","observation_id":"1da4d559-0da8-4d4a-90f0-381bb556ee85","resolution":{"observed_at":"2026-08-07T13:26:12.701262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:12.419490Z","title":"Sniper: Efficient multi- scale training","venue":null,"work_id":"3f7af97c-f25c-45df-b34c-de6b0b078c23","year":2018},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:04.384019Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:d0706c502f9bf4af51a529b3b20a38ca1beb29eab73072935b099d4b90125db5","observation_id":"e027b9e3-aa44-4c08-b81f-dab544fa4b75","resolution":{"observed_at":"2026-08-07T13:26:12.546162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:12.165718Z","title":"Sparse r-cnn: End-to-end object detection with learnable proposals","venue":null,"work_id":"f88db2e1-45d8-4ce4-a76a-826e40aaded3","year":2021},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:04.424288Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:f3f5a31b4d804e5b5c416df04fd6062cac114afa4ead5b8a932943bd8a21c9ed","observation_id":"2592fe78-bc51-4128-8d32-4e8cfe05ca22","resolution":{"observed_at":"2026-08-07T13:26:12.287431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:11.922498Z","title":"An image patch is a wave: Phase-aware vision mlp","venue":null,"work_id":"ed78b651-5075-406f-8e4d-ef74711c7a50","year":2022},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:04.476765Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:224a872049d07b009c07c4215a2215e2ef43a72e442a017f66fc6a848b27b217","observation_id":"b9fa168d-3535-4bb1-9d58-1b2f9854a9f1","resolution":{"observed_at":"2026-08-07T13:26:12.058060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:11.765802Z","title":"Multi- scale sampling attention graph convolutional networks for skeleton- based action recognition","venue":null,"work_id":"cf2b88c2-48c3-454e-a41d-968178b788eb","year":2024},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:04.532259Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:ee08d885b70d46aeaeb18a92443f3806a2f402c363a564c820f8ca4b4ddcaaee","observation_id":"6a5c8f70-f831-46dc-a0ab-90f8083db2f9","resolution":{"observed_at":"2026-08-07T13:26:11.859449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:11.527774Z","title":"Training data-efficient image transformers & distillation through attention","venue":null,"work_id":"cee27832-bc5c-4071-816f-2ec3e87691df","year":2021},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:04.580178Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:6f6e0ccf96b4d5cf4c1bdc087ed315655b9cae61bdaeba99672fc8a22dc35112","observation_id":"03a68a71-b5f3-43cf-a743-4491c0293806","resolution":{"observed_at":"2026-08-07T13:26:11.619025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:11.288261Z","title":"Yolov7: Trainable bag-of-freebies sets new state-of-the-art for real-time object detectors","venue":null,"work_id":"59df1f03-d81e-47fd-829c-19d3a10ff154","year":2023},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:04.616323Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:fe71e39f40d2b1318acdcf953ccf98ec73f1b60cce16d6432d8a4eb1bb29907f","observation_id":"a739471f-86f6-4a93-af30-c600cdc09541","resolution":{"observed_at":"2026-08-07T13:26:11.406730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.13389","last_updated":"2022-06-14T12:58:44Z","snapshot_observed_at":"2026-07-06T12:01:47.870599Z","submitted_at":"2021-10-26T03:43:17Z","title":"A Normalized Gaussian Wasserstein Distance for Tiny Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.13389","snapshot_observed_at":"2026-08-07T13:26:04.651499Z","title":"A normalized gaussian wasserstein distance for tiny object detection","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:04.651499Z"},"links":{"cited_paper":"/paper/2110.13389","citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:ae805f0425dce1c8515c00ab51db316f231e85aa3307576249e2c78ea17968eb","observation_id":"70dcdd5b-4b2e-490a-8489-7df632edcbd4","resolution":{"observed_at":"2026-08-07T13:26:04.651499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:11.110550Z","title":"Tiny object detection in aerial images","venue":null,"work_id":"d93823d6-805b-47a0-9711-adf50fbdeebc","year":2020},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:04.688014Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:3a1d3177250f304aa121c937bac15f4c5daac68dd3a18b567e300fdaf3c21673","observation_id":"a026be6d-94dc-4125-af47-c25cf17328a1","resolution":{"observed_at":"2026-08-07T13:26:11.175060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:10.920871Z","title":"Convnext v2: Co-designing and scaling convnets with masked autoencoders","venue":null,"work_id":"a19af6af-3fba-4cbb-8788-54188c8882ec","year":2023},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:04.723563Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:a6ce4089670d7d09f73c523223479988b4a7660d73b02a056a466ac453ec892e","observation_id":"83cfd4e5-3bb3-4c55-b942-e34189b4e7fe","resolution":{"observed_at":"2026-08-07T13:26:11.016269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:10.780203Z","title":"Rfla: Gaussian receptive field based label assignment for tiny object detection","venue":null,"work_id":"c8724c36-81da-41ca-9c71-7c1912bb049b","year":2022},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:04.795005Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:9782933964d60a0aec5ab6b006b87995ad290f5a82783a8324ff75f786886bb3","observation_id":"c077c8f6-6a96-449f-a22a-7e52a509dc6a","resolution":{"observed_at":"2026-08-07T13:26:10.826582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:10.605829Z","title":"Querydet: Cas- caded sparse query for accelerating high-resolution small object detec- tion","venue":null,"work_id":"3abd9e92-bfc6-4e54-831c-f1c4149bbba6","year":2022},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:04.851864Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:626f28fd0d2334e1a482536f73a9d7eb135647a678dffabe369fad72407aa3ae","observation_id":"b682cd6a-027c-43ae-b2b2-2c58aeab0058","resolution":{"observed_at":"2026-08-07T13:26:10.645076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:10.452789Z","title":"Rep- points: Point set representation for object detection","venue":null,"work_id":"64cba7a7-e989-48a8-8974-e83c983b69eb","year":2019},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:04.916714Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:50458ec42f04b4a1737e41b702390b4d512e3f12cf4df45cabf559f46638b215","observation_id":"f5420837-1b0e-4410-b8ee-b95490b72f73","resolution":{"observed_at":"2026-08-07T13:26:10.519782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01318","last_updated":"2021-04-03T06:14:24Z","snapshot_observed_at":"2026-07-06T10:56:13.719183Z","submitted_at":"2021-04-03T06:14:24Z","title":"Efficient DETR: Improving End-to-End Object Detector with Dense Prior","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01318","snapshot_observed_at":"2026-08-07T13:26:04.971142Z","title":"Efficient detr: improving end-to-end object detector with dense prior","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:04.971142Z"},"links":{"cited_paper":"/paper/2104.01318","citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:51148739d7ec9ba96a212b2f6a1ccff1342230a13bc4375311f6c2bf9a2b09c7","observation_id":"f23a2718-9c88-4dec-932c-fc8d30e0d5e4","resolution":{"observed_at":"2026-08-07T13:26:04.971142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.07122","last_updated":"2016-04-30T18:19:37Z","snapshot_observed_at":"2026-07-06T04:37:24.552839Z","submitted_at":"2015-11-23T07:32:14Z","title":"Multi-Scale Context Aggregation by Dilated Convolutions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.07122","snapshot_observed_at":"2026-08-07T13:26:05.022159Z","title":"Multi-scale context aggregation by dilated convolutions","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:05.022159Z"},"links":{"cited_paper":"/paper/1511.07122","citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:49cac45de1fdb6cb7f361f50ca5a5bb211dff8dc7a082734daa051bfc84f50d3","observation_id":"bcb663a8-45b4-4076-83b3-460cb1be6427","resolution":{"observed_at":"2026-08-07T13:26:05.022159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:10.266050Z","title":"Small object detection via coarse-to-fine proposal generation and imitation learning","venue":null,"work_id":"a188ce1f-331d-4da0-94a3-5adf104b6cae","year":2023},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:05.055445Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:2a3ad70556f5f5e9077c5702fefcbef8c2461696e802577a532b5071ac2f808a","observation_id":"daf592d1-90ff-4951-8526-efe3128a6d3f","resolution":{"observed_at":"2026-08-07T13:26:10.334094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:10.135994Z","title":"Dino: Detr with improved denoising anchor boxes for end-to-end object detection","venue":null,"work_id":"3b3ed1fc-4b0c-4254-ba85-d6bf8f5ca7b9","year":2022},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:05.136239Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:a8e62dd2d0e951d59d1a96a4ea998caf7064352c312457e49b5312f48be8b281","observation_id":"12e1cd18-a413-401d-a41a-d012c359ba2f","resolution":{"observed_at":"2026-08-07T13:26:10.208475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:09.071404Z","title":"Single-shot refinement neural network for object detection","venue":null,"work_id":"c0267ac7-ff6f-4260-82b2-c2f042ed474d","year":2018},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:05.202543Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:d10418f33a417d079f508602e46dc27e36651ea847d69d92007e9be50ab6e17a","observation_id":"f5c91ad2-0ba6-42f9-8b73-04da5fe70378","resolution":{"observed_at":"2026-08-07T13:26:09.984971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:07.686484Z","title":"Widerperson: A diverse dataset for dense pedestrian detection in the wild","venue":null,"work_id":"1a555d1b-0f32-4c8d-8b84-5869151ee59e","year":2019},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:05.275479Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:a7827eefa2439b287fb6b9bda23b3ecc2003792d9049477bf230183e0f63fa37","observation_id":"dece96cf-6bf6-4ef5-92e0-c3a505b4e053","resolution":{"observed_at":"2026-08-07T13:26:08.242210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:07.254283Z","title":"Less is more: Focus attention for efficient detr","venue":null,"work_id":"f30ca5ac-38c6-4e25-a31c-a0c0f9068337","year":2023},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:05.347262Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:140bb2dc785867bc0ac5e4e945955b74e154e16bf8daf81a343935e7a02fdbb7","observation_id":"65a69d4e-1953-4583-b41f-94c6ac9362f8","resolution":{"observed_at":"2026-08-07T13:26:07.416452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:05.481510Z","title":"Learning deep features for discriminative localization","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:05.481510Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:33990923fed9924975d4c8326f7880002d1392559991c1fde0fd4edb7f36238f","observation_id":"e3fa4d08-8387-4a23-9434-4d67c5e81ba2","resolution":{"observed_at":"2026-08-07T13:26:05.481510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:06.950830Z","title":"Detection and tracking meet drones challenge","venue":null,"work_id":"370f9bcf-2550-468f-a20e-b1aa372d792a","year":2021},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:05.527472Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:41637679c59f3171e422f23a1285adb46b72d058242e8234c1da21a54e5cda25","observation_id":"ed6e1b0c-2a58-4a97-aa82-a236d1653f2b","resolution":{"observed_at":"2026-08-07T13:26:07.041014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:06.731975Z","title":"Deformable detr: Deformable transformers for end-to-end object detection","venue":null,"work_id":"676a9494-6dbc-405d-a175-8dff4a277bd9","year":2020},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:05.651356Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:96dcc75ef78ffeeba749d34a01f78d4888a15788097aa7645220f4cd22218d7c","observation_id":"218e5c74-0614-459d-a91c-5b8a46d511b6","resolution":{"observed_at":"2026-08-07T13:26:06.840035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:06.527052Z","title":"Detrs with collaborative hy- brid assignments training","venue":null,"work_id":"8455492f-ddbb-4bda-9edb-6e32a0391bf7","year":2023},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:05.716667Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:032e63b4efda6be3974e5627a08fa3e2ad1a49d501fc80ad44220dec36861f1e","observation_id":"932f4263-0505-429c-862c-264743c245eb","resolution":{"observed_at":"2026-08-07T13:26:06.587958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:06.366444Z","title":"Learning data augmentation strategies for object detection","venue":null,"work_id":"bb380fdc-51c5-4da7-980a-9862b64acd0e","year":2020},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:05.765929Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:4e35badeadf72b2603b94fff64e53e3933fc56cea9df11000222af65df89120e","observation_id":"368e4b99-2cfe-4038-85dc-9acaba3f565f","resolution":{"observed_at":"2026-08-07T13:26:06.454813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0200.9995","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:06.032354Z","title":"Object detection in 20 years: A survey","venue":null,"work_id":"6ead9bb4-f642-4592-a1fe-2a583deaed07","year":2023},"citing_paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:05.840078Z"},"links":{"citing_paper":"/paper/2505.21868"},"observation_digest":"sha256:84690627194f0aa2ef17402f3213da09caab390c79fa326fc002754ebc278224","observation_id":"433986bd-0465-464b-bb5c-9c726e85ec33","resolution":{"observed_at":"2026-08-07T13:26:06.071587Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.21868","last_updated":"2025-05-28T01:33:23Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T23:39:09.559509Z","submitted_at":"2025-05-28T01:33:23Z","title":"Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection"},"reference_resolution":{"displayed":77,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":1,"verified_fuzzy":53},"total_outbound_references":77},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 77 of 77 outbound references and 1 inbound Pith citation observation for arXiv:2505.21868."}