{"as_of":"2026-08-18T13:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e5faff8c0b571f4341b4c4d0891d74d4cc2f8fe1ebc4a4f37a1ca2561410cee6","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:34:34.785560Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.06937/citation-record","integrity":"/paper/2505.06937/integrity","json":"/paper/2505.06937/citation-record.json","paper":"/paper/2505.06937"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:35.675038Z","title":"Frequency bias in neural networks for input of non-uniform density","venue":null,"work_id":"5bee1d15-b681-46c9-89a6-1eada9b9d2b8","year":2020},"citing_paper":{"arxiv_id":"2505.06937","last_updated":"2025-05-11T10:55:14Z","snapshot_observed_at":"2026-08-16T04:24:01.207244Z","submitted_at":"2025-05-11T10:55:14Z","title":"Transformer-Based Dual-Optical Attention Fusion Crowd Head Point Counting and Localization Network","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T22:34:34.580615Z"},"links":{"citing_paper":"/paper/2505.06937"},"observation_digest":"sha256:78a2479d1180c895c51c2dd0e78c1f790b2b9e38019b27e400c90ce691ba3ead","observation_id":"19a91b48-8ea1-4ba7-95ba-9c4fa7cf6144","resolution":{"observed_at":"2026-08-15T22:34:35.679224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10589","last_updated":"2024-05-17T07:23:27Z","snapshot_observed_at":"2026-08-16T13:51:57.437540Z","submitted_at":"2024-05-17T07:23:27Z","title":"Improving Point-based Crowd Counting and Localization Based on Auxiliary Point Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10589","snapshot_observed_at":"2026-08-15T22:34:34.585521Z","title":"Improving point-based crowd counting and localization based on auxiliary point guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.06937","last_updated":"2025-05-11T10:55:14Z","snapshot_observed_at":"2026-08-16T04:24:01.207244Z","submitted_at":"2025-05-11T10:55:14Z","title":"Transformer-Based Dual-Optical Attention Fusion Crowd Head Point Counting and Localization Network","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T22:34:34.585521Z"},"links":{"cited_paper":"/paper/2405.10589","citing_paper":"/paper/2505.06937"},"observation_digest":"sha256:f1b999d25f621935fe7f4d75c45cf5aa7cb9bde34a0de6ff82aeea38601ba9aa","observation_id":"d9293d5a-fdcc-4c47-b280-a50e08655ad4","resolution":{"observed_at":"2026-08-15T22:34:34.585521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:35.661651Z","title":"The effectiveness of a simplified model structure for crowd counting","venue":null,"work_id":"8638f23f-4902-4803-98ab-ef14531aa5ae","year":2024},"citing_paper":{"arxiv_id":"2505.06937","last_updated":"2025-05-11T10:55:14Z","snapshot_observed_at":"2026-08-16T04:24:01.207244Z","submitted_at":"2025-05-11T10:55:14Z","title":"Transformer-Based Dual-Optical Attention Fusion Crowd Head Point Counting and Localization Network","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T22:34:34.590267Z"},"links":{"citing_paper":"/paper/2505.06937"},"observation_digest":"sha256:649396e24f8be9d9920035843eadc82356146b59ef9f30157fc3c308deacc002","observation_id":"ff51de3c-04a6-4770-8adc-d592b203dcb9","resolution":{"observed_at":"2026-08-15T22:34:35.665739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.00057","last_updated":"2021-06-30T18:41:47Z","snapshot_observed_at":"2026-08-16T18:13:12.336561Z","submitted_at":"2021-06-30T18:41:47Z","title":"Simple Training Strategies and Model Scaling for Object Detection","version":1},"cited_work":{"arxiv_id":"2107.00057","doi":null,"metadata_source":"pith","pith_arxiv_id":"2107.00057","snapshot_observed_at":"2026-08-15T22:34:35.160617Z","title":"Simple Training Strategies and Model Scaling for Object Detection","venue":"cs.CV","work_id":"da0bc96c-be84-4494-bf0d-61ea187bb345","year":2021},"citing_paper":{"arxiv_id":"2505.06937","last_updated":"2025-05-11T10:55:14Z","snapshot_observed_at":"2026-08-16T04:24:01.207244Z","submitted_at":"2025-05-11T10:55:14Z","title":"Transformer-Based Dual-Optical Attention Fusion Crowd Head Point Counting and Localization Network","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T22:34:34.594490Z"},"links":{"cited_paper":"/paper/2107.00057","citing_paper":"/paper/2505.06937"},"observation_digest":"sha256:c14c3f68fdc0fe218b9ad1b5b5cebd349ac3199a4da7099f3ebf86d20f66f1f3","observation_id":"d63b9c9c-4575-4c3c-acd1-b0f396512b9b","resolution":{"observed_at":"2026-08-15T22:34:35.165820Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.00273","last_updated":"2022-10-04T09:52:39Z","snapshot_observed_at":"2026-08-18T10:37:19.014567Z","submitted_at":"2021-10-30T15:34:12Z","title":"Cross-Modality Fusion Transformer for Multispectral Object Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.00273","snapshot_observed_at":"2026-08-15T22:34:34.599211Z","title":"Cross-modality fusion trans- former for multispectral object detection","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.06937","last_updated":"2025-05-11T10:55:14Z","snapshot_observed_at":"2026-08-16T04:24:01.207244Z","submitted_at":"2025-05-11T10:55:14Z","title":"Transformer-Based Dual-Optical Attention Fusion Crowd Head Point Counting and Localization Network","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T22:34:34.599211Z"},"links":{"cited_paper":"/paper/2111.00273","citing_paper":"/paper/2505.06937"},"observation_digest":"sha256:39af2d3dfcb7de5d7e3e9b7f200458a82c10f6280019cff43f188238cbd8e203","observation_id":"26939a66-d55a-4275-b9ca-3f918c082a50","resolution":{"observed_at":"2026-08-15T22:34:34.599211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:35.647456Z","title":"Lraf-net: Long-range attention fusion network for visible–infrared object detection.IEEE Transac- tions on Neural Networks and Learning Systems, 35:13232– 13243, 2023","venue":null,"work_id":"9a105860-a229-4d3b-8cb8-05e32c2de5b6","year":2023},"citing_paper":{"arxiv_id":"2505.06937","last_updated":"2025-05-11T10:55:14Z","snapshot_observed_at":"2026-08-16T04:24:01.207244Z","submitted_at":"2025-05-11T10:55:14Z","title":"Transformer-Based Dual-Optical Attention Fusion Crowd Head Point Counting and Localization Network","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T22:34:34.604206Z"},"links":{"citing_paper":"/paper/2505.06937"},"observation_digest":"sha256:0b9d3884c98d43e124a8994743d76156ba62cebe67c6b6ebdf13f5641ed754ad","observation_id":"f2c93a20-d34e-4e2a-9741-0018746e19d4","resolution":{"observed_at":"2026-08-15T22:34:35.652165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.04164","last_updated":"2022-10-12T01:09:38Z","snapshot_observed_at":"2026-08-16T19:00:15.272176Z","submitted_at":"2020-12-08T02:17:19Z","title":"Learning Independent Instance Maps for Crowd Localization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.04164","snapshot_observed_at":"2026-08-15T22:34:34.609153Z","title":"Learning independent instance maps for crowd localization","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.06937","last_updated":"2025-05-11T10:55:14Z","snapshot_observed_at":"2026-08-16T04:24:01.207244Z","submitted_at":"2025-05-11T10:55:14Z","title":"Transformer-Based Dual-Optical Attention Fusion Crowd Head Point Counting and Localization Network","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T22:34:34.609153Z"},"links":{"cited_paper":"/paper/2012.04164","citing_paper":"/paper/2505.06937"},"observation_digest":"sha256:a0f408c2d72f79809a1da0711e0bcf96311065f1fe395a8495bf2d499c535e57","observation_id":"8bf04c18-8b5c-4820-b634-7ce4a80a5bea","resolution":{"observed_at":"2026-08-15T22:34:34.609153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:35.632505Z","title":"Simple copy-paste is a strong data augmentation method for instance segmentation","venue":null,"work_id":"f5c7fa14-c06e-48b3-b668-c7c8c515e327","year":2020},"citing_paper":{"arxiv_id":"2505.06937","last_updated":"2025-05-11T10:55:14Z","snapshot_observed_at":"2026-08-16T04:24:01.207244Z","submitted_at":"2025-05-11T10:55:14Z","title":"Transformer-Based Dual-Optical Attention Fusion Crowd Head Point Counting and Localization Network","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T22:34:34.613862Z"},"links":{"citing_paper":"/paper/2505.06937"},"observation_digest":"sha256:99f536e05abac04799f0837cd537014a31923464174cbf4b86926a31e76483ab","observation_id":"a16709ba-c94f-4a04-bc8c-897ec83217b5","resolution":{"observed_at":"2026-08-15T22:34:35.637550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:34.618232Z","title":"Dpdetr: Decoupled position detection transformer for infrared-visible object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.06937","last_updated":"2025-05-11T10:55:14Z","snapshot_observed_at":"2026-08-16T04:24:01.207244Z","submitted_at":"2025-05-11T10:55:14Z","title":"Transformer-Based Dual-Optical Attention Fusion Crowd Head Point Counting and Localization Network","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T22:34:34.618232Z"},"links":{"citing_paper":"/paper/2505.06937"},"observation_digest":"sha256:b214db37b5adea02ce80a47c006595ceeb29c88e4b248d28fbfa3c9b45fad7bc","observation_id":"e4faa797-2398-46f9-b95c-ff8c7b74dfb5","resolution":{"observed_at":"2026-08-15T22:34:34.618232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.01050","last_updated":"2018-08-02T23:38:48Z","snapshot_observed_at":"2026-08-14T21:45:40.455568Z","submitted_at":"2018-08-02T23:38:48Z","title":"Composition Loss for Counting, Density Map Estimation and Localization in Dense Crowds","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.01050","snapshot_observed_at":"2026-08-15T22:34:34.622456Z","title":"Composition loss for counting, den- sity map estimation and localization in dense crowds","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.06937","last_updated":"2025-05-11T10:55:14Z","snapshot_observed_at":"2026-08-16T04:24:01.207244Z","submitted_at":"2025-05-11T10:55:14Z","title":"Transformer-Based Dual-Optical Attention Fusion Crowd Head Point Counting and Localization Network","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T22:34:34.622456Z"},"links":{"cited_paper":"/paper/1808.01050","citing_paper":"/paper/2505.06937"},"observation_digest":"sha256:735202852967c3fe66dd1cfd6ad522dbb7b91466bfb5803f58ff631127e9ba2f","observation_id":"25f8c198-4a32-4d9c-b3f8-49fec092efe9","resolution":{"observed_at":"2026-08-15T22:34:34.622456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:35.616953Z","title":"Attention scaling for crowd counting","venue":null,"work_id":"a1ed8898-b6f2-4316-837d-53c2e11e8022","year":2020},"citing_paper":{"arxiv_id":"2505.06937","last_updated":"2025-05-11T10:55:14Z","snapshot_observed_at":"2026-08-16T04:24:01.207244Z","submitted_at":"2025-05-11T10:55:14Z","title":"Transformer-Based Dual-Optical Attention Fusion Crowd Head Point Counting and Localization Network","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T22:34:34.628114Z"},"links":{"citing_paper":"/paper/2505.06937"},"observation_digest":"sha256:5ad2e5836e35bb6306892ae17d5d34b66dd17ab13d6c53b8c6565c86c7aece95","observation_id":"ebcc5b5f-fdf1-4f80-a78a-8276a7ff3f1a","resolution":{"observed_at":"2026-08-15T22:34:35.622207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:35.602009Z","title":"Multimodal crowd counting with pix2pix gans","venue":null,"work_id":"32f2f2c6-8ec6-4b71-8f54-63327491be73","year":2024},"citing_paper":{"arxiv_id":"2505.06937","last_updated":"2025-05-11T10:55:14Z","snapshot_observed_at":"2026-08-16T04:24:01.207244Z","submitted_at":"2025-05-11T10:55:14Z","title":"Transformer-Based Dual-Optical Attention Fusion Crowd Head Point Counting and Localization Network","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T22:34:34.632751Z"},"links":{"citing_paper":"/paper/2505.06937"},"observation_digest":"sha256:362327b55f4d083584ee1a1dfccb655b33809a7b7d3c18de75240f0e4186357b","observation_id":"2c466b3b-f45f-4180-82e4-f7f2e637d10a","resolution":{"observed_at":"2026-08-15T22:34:35.606790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:35.586818Z","title":"The hungarian method for the assignment problem","venue":null,"work_id":"1ff59985-4784-4ab5-b1cc-5335c735eeff","year":1955},"citing_paper":{"arxiv_id":"2505.06937","last_updated":"2025-05-11T10:55:14Z","snapshot_observed_at":"2026-08-16T04:24:01.207244Z","submitted_at":"2025-05-11T10:55:14Z","title":"Transformer-Based Dual-Optical Attention Fusion Crowd Head Point Counting and Localization Network","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T22:34:34.637382Z"},"links":{"citing_paper":"/paper/2505.06937"},"observation_digest":"sha256:694d67199c6f27e1ea4b547baf3c054d804b563576e1ba1c53e4fe1e91c48aca","observation_id":"4ae70afe-586b-49ca-a1c8-2df7609edd61","resolution":{"observed_at":"2026-08-15T22:34:35.591596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:35.571869Z","title":"Illumination-aware faster r-cnn for robust multispectral pedestrian detection","venue":null,"work_id":"a3866b8f-554b-4546-a7e3-0c99e3c6d13a","year":2018},"citing_paper":{"arxiv_id":"2505.06937","last_updated":"2025-05-11T10:55:14Z","snapshot_observed_at":"2026-08-16T04:24:01.207244Z","submitted_at":"2025-05-11T10:55:14Z","title":"Transformer-Based Dual-Optical Attention Fusion Crowd Head Point Counting and Localization Network","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T22:34:34.642211Z"},"links":{"citing_paper":"/paper/2505.06937"},"observation_digest":"sha256:3ae560aa5ddfb614de165c72b579adb0a8129223f2bb19704ff448a77947ced6","observation_id":"53f1f189-97b2-46de-9ca5-5610e10dd7e3","resolution":{"observed_at":"2026-08-15T22:34:35.576852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:35.557785Z","title":"Confidence-aware fusion using dempster- shafer theory for multispectral pedestrian detection","venue":null,"work_id":"172666ea-3c3b-48da-9fdd-ad2adb0e6f77","year":2023},"citing_paper":{"arxiv_id":"2505.06937","last_updated":"2025-05-11T10:55:14Z","snapshot_observed_at":"2026-08-16T04:24:01.207244Z","submitted_at":"2025-05-11T10:55:14Z","title":"Transformer-Based Dual-Optical Attention Fusion Crowd Head Point Counting and Localization Network","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T22:34:34.646964Z"},"links":{"citing_paper":"/paper/2505.06937"},"observation_digest":"sha256:2b43c688cd2ea4d81ecef4a7fd1d9b9855f721befc16322fa6a93735531f6cee","observation_id":"65ead651-6330-4391-ba11-8c40e9dd5054","resolution":{"observed_at":"2026-08-15T22:34:35.561923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:35.543996Z","title":"Stabilizing multispectral pedestrian de- tection with evidential hybrid fusion","venue":null,"work_id":"e3acb6fd-0ec2-4930-8786-e52cd9605db8","year":2024},"citing_paper":{"arxiv_id":"2505.06937","last_updated":"2025-05-11T10:55:14Z","snapshot_observed_at":"2026-08-16T04:24:01.207244Z","submitted_at":"2025-05-11T10:55:14Z","title":"Transformer-Based Dual-Optical Attention Fusion Crowd Head Point Counting and Localization Network","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T22:34:34.651691Z"},"links":{"citing_paper":"/paper/2505.06937"},"observation_digest":"sha256:2d4fafd7f9e3948907527d9272decf9c712fe360d9e77a41bfa26807b112a350","observation_id":"4a224724-5663-440c-ba15-c75560a3537c","resolution":{"observed_at":"2026-08-15T22:34:35.548460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:35.530093Z","title":"Focal inverse distance transform maps for crowd localization","venue":null,"work_id":"a83d3ffb-f42d-4dd3-b052-fd89b76b8afc","year":2021},"citing_paper":{"arxiv_id":"2505.06937","last_updated":"2025-05-11T10:55:14Z","snapshot_observed_at":"2026-08-16T04:24:01.207244Z","submitted_at":"2025-05-11T10:55:14Z","title":"Transformer-Based Dual-Optical Attention Fusion Crowd Head Point Counting and Localization Network","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T22:34:34.656239Z"},"links":{"citing_paper":"/paper/2505.06937"},"observation_digest":"sha256:fc3f22ae697b6e8e5e94453451ac13938a304e5551639c8a795b1f15994aee00","observation_id":"d4c160e7-0194-47a4-8e8f-f36631e6d03b","resolution":{"observed_at":"2026-08-15T22:34:35.534242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.13065","last_updated":"2022-08-08T10:56:39Z","snapshot_observed_at":"2026-08-16T17:18:29.818468Z","submitted_at":"2022-02-26T05:21:30Z","title":"An End-to-End Transformer Model for Crowd Localization","version":2},"cited_work":{"arxiv_id":"2202.13065","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.13065","snapshot_observed_at":"2026-08-15T22:34:34.909744Z","title":"An End-to-End Transformer Model for Crowd Localization","venue":"cs.CV","work_id":"422826fc-4c69-4183-affd-4bbad0023ad1","year":2022},"citing_paper":{"arxiv_id":"2505.06937","last_updated":"2025-05-11T10:55:14Z","snapshot_observed_at":"2026-08-16T04:24:01.207244Z","submitted_at":"2025-05-11T10:55:14Z","title":"Transformer-Based Dual-Optical Attention Fusion Crowd Head Point Counting and Localization Network","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T22:34:34.660657Z"},"links":{"cited_paper":"/paper/2202.13065","citing_paper":"/paper/2505.06937"},"observation_digest":"sha256:b6f8ceb97b9fa17fd731852a1af4dc0ed1eaef8ee8743208e788a935c11f9c2e","observation_id":"b2382396-d412-455a-98ac-7c3b816a9665","resolution":{"observed_at":"2026-08-15T22:34:34.914880Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:35.516048Z","title":"Lin and A","venue":null,"work_id":"6ce49031-f963-4bd0-ace8-129563dff894","year":2023},"citing_paper":{"arxiv_id":"2505.06937","last_updated":"2025-05-11T10:55:14Z","snapshot_observed_at":"2026-08-16T04:24:01.207244Z","submitted_at":"2025-05-11T10:55:14Z","title":"Transformer-Based Dual-Optical Attention Fusion Crowd Head Point Counting and Localization Network","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T22:34:34.665493Z"},"links":{"citing_paper":"/paper/2505.06937"},"observation_digest":"sha256:d864cf092cab3e39cac327863254886b8162c424fd3bea46720e82eda57e2026","observation_id":"266a5dd8-18dd-486b-bf21-d9cc15f39097","resolution":{"observed_at":"2026-08-15T22:34:35.520502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:35.501772Z","title":"Point-query quadtree for crowd counting, localization, and more","venue":null,"work_id":"e74bcb3c-d0c3-4378-839a-d06cb665e921","year":2023},"citing_paper":{"arxiv_id":"2505.06937","last_updated":"2025-05-11T10:55:14Z","snapshot_observed_at":"2026-08-16T04:24:01.207244Z","submitted_at":"2025-05-11T10:55:14Z","title":"Transformer-Based Dual-Optical Attention Fusion Crowd Head Point Counting and Localization Network","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T22:34:34.670068Z"},"links":{"citing_paper":"/paper/2505.06937"},"observation_digest":"sha256:d26b88d921f3d63d7c9968683c3ff7853e0198bf1c9e2f0b2720fcaba6362b89","observation_id":"5fb6137e-513a-43ba-b282-bc739013cd28","resolution":{"observed_at":"2026-08-15T22:34:35.506407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:35.487619Z","title":"Multispectral deep neural networks for pedes- trian detection","venue":null,"work_id":"65a29301-abae-4cf3-8e1c-c5a8f826c26f","year":2016},"citing_paper":{"arxiv_id":"2505.06937","last_updated":"2025-05-11T10:55:14Z","snapshot_observed_at":"2026-08-16T04:24:01.207244Z","submitted_at":"2025-05-11T10:55:14Z","title":"Transformer-Based Dual-Optical Attention Fusion Crowd Head Point Counting and Localization Network","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T22:34:34.674684Z"},"links":{"citing_paper":"/paper/2505.06937"},"observation_digest":"sha256:d6e7d6e4212699ffb69fbcf848655bdb0d9467eb5107aabebf35ab3abb80e4bb","observation_id":"21e119a8-28d3-4416-938b-9b79f1c83670","resolution":{"observed_at":"2026-08-15T22:34:35.492056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:35.473072Z","title":"Leveraging self-supervision for cross-domain crowd counting","venue":null,"work_id":"0ba26b2e-e6d9-4817-8197-8618861b5587","year":2022},"citing_paper":{"arxiv_id":"2505.06937","last_updated":"2025-05-11T10:55:14Z","snapshot_observed_at":"2026-08-16T04:24:01.207244Z","submitted_at":"2025-05-11T10:55:14Z","title":"Transformer-Based Dual-Optical Attention Fusion Crowd Head Point Counting and Localization Network","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T22:34:34.678757Z"},"links":{"citing_paper":"/paper/2505.06937"},"observation_digest":"sha256:91bc4aeb4dd2a10e759199c81217057d85be0f99a5c7763307008a5592d5b01c","observation_id":"0a99b460-577e-4815-b727-a06c879b49db","resolution":{"observed_at":"2026-08-15T22:34:35.477550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:35.458303Z","title":"Point in, box out: Beyond counting persons in crowds","venue":null,"work_id":"ceb1d3f5-eec8-4b0d-958a-a87edc45bcc5","year":2019},"citing_paper":{"arxiv_id":"2505.06937","last_updated":"2025-05-11T10:55:14Z","snapshot_observed_at":"2026-08-16T04:24:01.207244Z","submitted_at":"2025-05-11T10:55:14Z","title":"Transformer-Based Dual-Optical Attention Fusion Crowd Head Point Counting and Localization Network","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T22:34:34.682694Z"},"links":{"citing_paper":"/paper/2505.06937"},"observation_digest":"sha256:db5610ddf0756d7c43c55ac5e75669eb437b5f107e66a9b48392807bd771b49b","observation_id":"7e38b7a1-b713-4178-8d52-b6e54de53429","resolution":{"observed_at":"2026-08-15T22:34:35.463016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:35.443605Z","title":"Implicit neural representation in med- ical imaging: A comparative survey","venue":null,"work_id":"440d1d49-e3dc-424c-97c4-79959b7f0471","year":2023},"citing_paper":{"arxiv_id":"2505.06937","last_updated":"2025-05-11T10:55:14Z","snapshot_observed_at":"2026-08-16T04:24:01.207244Z","submitted_at":"2025-05-11T10:55:14Z","title":"Transformer-Based Dual-Optical Attention Fusion Crowd Head Point Counting and Localization Network","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T22:34:34.686590Z"},"links":{"citing_paper":"/paper/2505.06937"},"observation_digest":"sha256:6b090ab741fdfda0c10fa6d88b5a0fda52484fec495d03cce1dc089e69a385ea","observation_id":"e4815298-2bf0-41ab-957a-3c6aeced5682","resolution":{"observed_at":"2026-08-15T22:34:35.448462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:35.428495Z","title":"Deepsdf: Learning continuous signed distance functions for shape representation","venue":null,"work_id":"d88d20d2-0365-4dfa-b2e6-323af89386f9","year":2019},"citing_paper":{"arxiv_id":"2505.06937","last_updated":"2025-05-11T10:55:14Z","snapshot_observed_at":"2026-08-16T04:24:01.207244Z","submitted_at":"2025-05-11T10:55:14Z","title":"Transformer-Based Dual-Optical Attention Fusion Crowd Head Point Counting and Localization Network","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T22:34:34.690357Z"},"links":{"citing_paper":"/paper/2505.06937"},"observation_digest":"sha256:2a6072abfdba1fd90ea75f94a7b6556324343bf32a6d89b935019b748b36c50f","observation_id":"5dfe5c46-cf08-493e-b7b0-7b751d4bcbca","resolution":{"observed_at":"2026-08-15T22:34:35.433302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:35.414289Z","title":"Rgb-t crowd counting from drone: A benchmark and mmccn network","venue":null,"work_id":"69c9ee45-145c-4dac-981a-444487119f79","year":2020},"citing_paper":{"arxiv_id":"2505.06937","last_updated":"2025-05-11T10:55:14Z","snapshot_observed_at":"2026-08-16T04:24:01.207244Z","submitted_at":"2025-05-11T10:55:14Z","title":"Transformer-Based Dual-Optical Attention Fusion Crowd Head Point Counting and Localization Network","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T22:34:34.695198Z"},"links":{"citing_paper":"/paper/2505.06937"},"observation_digest":"sha256:d4c32745d6b5b92581d573d8e80eaf310603dd8c66731049c2fd303c01288f4c","observation_id":"123c3fd8-7aac-473d-9462-f20c5ef89acf","resolution":{"observed_at":"2026-08-15T22:34:35.418923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:35.399469Z","title":"On the spectral bias of neural net- works","venue":null,"work_id":"6d534740-b7ff-4283-b6dd-466ffccc3605","year":2018},"citing_paper":{"arxiv_id":"2505.06937","last_updated":"2025-05-11T10:55:14Z","snapshot_observed_at":"2026-08-16T04:24:01.207244Z","submitted_at":"2025-05-11T10:55:14Z","title":"Transformer-Based Dual-Optical Attention Fusion Crowd Head Point Counting and Localization Network","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T22:34:34.699736Z"},"links":{"citing_paper":"/paper/2505.06937"},"observation_digest":"sha256:aa757a3d7c2d9a5d6d341dd986340ee63674facca29389575428f1bdf841768b","observation_id":"5901e4d3-f740-4e77-a0da-c1fd357fb5fa","resolution":{"observed_at":"2026-08-15T22:34:35.404285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:35.385215Z","title":"Faster r-cnn: Towards real-time ob- ject detection with region proposal networks","venue":null,"work_id":"96eb6ea4-39dc-4cec-84a6-c6ee1f3078a8","year":2015},"citing_paper":{"arxiv_id":"2505.06937","last_updated":"2025-05-11T10:55:14Z","snapshot_observed_at":"2026-08-16T04:24:01.207244Z","submitted_at":"2025-05-11T10:55:14Z","title":"Transformer-Based Dual-Optical Attention Fusion Crowd Head Point Counting and Localization Network","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T22:34:34.704214Z"},"links":{"citing_paper":"/paper/2505.06937"},"observation_digest":"sha256:4aa3c5da10ce29b9e2d94237ed65b43b2ffdd2358f761022d4fa2c1426e1dcdc","observation_id":"181f7a7a-11b2-4987-b6dd-ef542fe45ffd","resolution":{"observed_at":"2026-08-15T22:34:35.389694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:35.372246Z","title":"Locate, size, and count: Accu- rately resolving people in dense crowds via detection","venue":null,"work_id":"91e7766e-e3f9-4835-a82d-c1d1649d7875","year":2019},"citing_paper":{"arxiv_id":"2505.06937","last_updated":"2025-05-11T10:55:14Z","snapshot_observed_at":"2026-08-16T04:24:01.207244Z","submitted_at":"2025-05-11T10:55:14Z","title":"Transformer-Based Dual-Optical Attention Fusion Crowd Head Point Counting and Localization Network","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T22:34:34.709260Z"},"links":{"citing_paper":"/paper/2505.06937"},"observation_digest":"sha256:10b849c6ed74916c9c69ff7bd024fafb03efcfb02962d362cacdc3d2f21a17a2","observation_id":"2c89ee46-9207-4cdd-886e-99333f266080","resolution":{"observed_at":"2026-08-15T22:34:35.376048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07504","last_updated":"2023-08-15T00:02:10Z","snapshot_observed_at":"2026-08-16T15:08:30.184856Z","submitted_at":"2023-08-15T00:02:10Z","title":"ICAFusion: Iterative Cross-Attention Guided Feature Fusion for Multispectral Object Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.07504","snapshot_observed_at":"2026-08-15T22:34:34.714889Z","title":"Icafusion: Iterative cross-attention guided feature fusion for multispectral object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.06937","last_updated":"2025-05-11T10:55:14Z","snapshot_observed_at":"2026-08-16T04:24:01.207244Z","submitted_at":"2025-05-11T10:55:14Z","title":"Transformer-Based Dual-Optical Attention Fusion Crowd Head Point Counting and Localization Network","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T22:34:34.714889Z"},"links":{"cited_paper":"/paper/2308.07504","citing_paper":"/paper/2505.06937"},"observation_digest":"sha256:c380119ca11dff23be1d29a5e70c01825e6a0953edd2d0de1c7a93d3532d5dbc","observation_id":"d0881453-0c72-4b7d-bae9-89a03ecd0955","resolution":{"observed_at":"2026-08-15T22:34:34.714889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:35.359195Z","title":"Rethinking counting and localization in crowds: A purely point-based framework","venue":null,"work_id":"03d1a032-3108-480c-9964-d0f157ffc950","year":2021},"citing_paper":{"arxiv_id":"2505.06937","last_updated":"2025-05-11T10:55:14Z","snapshot_observed_at":"2026-08-16T04:24:01.207244Z","submitted_at":"2025-05-11T10:55:14Z","title":"Transformer-Based Dual-Optical Attention Fusion Crowd Head Point Counting and Localization Network","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T22:34:34.720217Z"},"links":{"citing_paper":"/paper/2505.06937"},"observation_digest":"sha256:71bdd07ff96694f049a765fbe098ecc6ebef898c2d52baa051e785275d7a95d9","observation_id":"8c7bbda0-1dd0-481c-8dde-2ff5bf5743bf","resolution":{"observed_at":"2026-08-15T22:34:35.363178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.10739","last_updated":"2020-06-18T17:59:11Z","snapshot_observed_at":"2026-07-06T09:30:32.320227Z","submitted_at":"2020-06-18T17:59:11Z","title":"Fourier Features Let Networks Learn High Frequency Functions in Low Dimensional Domains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.10739","snapshot_observed_at":"2026-08-15T22:34:34.724912Z","title":"Fourier features let networks learn high frequency functions in low dimensional domains","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.06937","last_updated":"2025-05-11T10:55:14Z","snapshot_observed_at":"2026-08-16T04:24:01.207244Z","submitted_at":"2025-05-11T10:55:14Z","title":"Transformer-Based Dual-Optical Attention Fusion Crowd Head Point Counting and Localization Network","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T22:34:34.724912Z"},"links":{"cited_paper":"/paper/2006.10739","citing_paper":"/paper/2505.06937"},"observation_digest":"sha256:0e6ed445c3447a9e2d7774712328c0d32bcb12bbc85456ba947f42768b2cc5f5","observation_id":"bb371b2c-e9aa-43c6-846a-90f16c5b1dda","resolution":{"observed_at":"2026-08-15T22:34:34.724912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:35.345341Z","title":"Counting in dense crowds using deep features","venue":null,"work_id":"68ea6e11-9932-48a9-9430-755105a33641","year":2015},"citing_paper":{"arxiv_id":"2505.06937","last_updated":"2025-05-11T10:55:14Z","snapshot_observed_at":"2026-08-16T04:24:01.207244Z","submitted_at":"2025-05-11T10:55:14Z","title":"Transformer-Based Dual-Optical Attention Fusion Crowd Head Point Counting and Localization Network","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T22:34:34.729844Z"},"links":{"citing_paper":"/paper/2505.06937"},"observation_digest":"sha256:cacec7d64dbbc4c8a41fcf9bd8f860dca824d1a5aa137d888066547f0b6b0fa5","observation_id":"194140b2-27a7-4dce-ad47-220c8e5c9450","resolution":{"observed_at":"2026-08-15T22:34:35.350202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:35.331036Z","title":"Multispectral pedestrian detection using deep fusion convolutional neural networks","venue":null,"work_id":"6c3a8759-faaa-4bc4-9e44-c19bbb37190d","year":2016},"citing_paper":{"arxiv_id":"2505.06937","last_updated":"2025-05-11T10:55:14Z","snapshot_observed_at":"2026-08-16T04:24:01.207244Z","submitted_at":"2025-05-11T10:55:14Z","title":"Transformer-Based Dual-Optical Attention Fusion Crowd Head Point Counting and Localization Network","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T22:34:34.734056Z"},"links":{"citing_paper":"/paper/2505.06937"},"observation_digest":"sha256:9153d687faa218cbd5d71a3bc0717534708efa8470ac8e4eceb6c5730589c638","observation_id":"14d37608-19f7-4795-a70b-92b7a0fcb1a1","resolution":{"observed_at":"2026-08-15T22:34:35.335563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:35.315529Z","title":"A generalized loss function for crowd counting and localization","venue":null,"work_id":"f03b6152-8e4d-484a-88ef-90c803aab9f8","year":2021},"citing_paper":{"arxiv_id":"2505.06937","last_updated":"2025-05-11T10:55:14Z","snapshot_observed_at":"2026-08-16T04:24:01.207244Z","submitted_at":"2025-05-11T10:55:14Z","title":"Transformer-Based Dual-Optical Attention Fusion Crowd Head Point Counting and Localization Network","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T22:34:34.738184Z"},"links":{"citing_paper":"/paper/2505.06937"},"observation_digest":"sha256:4b7073227f8bcb8f26dc62a4a2332af9299596bedbd3688bed1454fd7ca68d34","observation_id":"83fe224c-bf2b-4014-ac29-ceda19d76bb4","resolution":{"observed_at":"2026-08-15T22:34:35.320872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:35.300195Z","title":"Dronenet: Rescue drone-view object detection","venue":null,"work_id":"71c77bf6-fc6a-40ba-b86f-193d52e7db9e","year":2023},"citing_paper":{"arxiv_id":"2505.06937","last_updated":"2025-05-11T10:55:14Z","snapshot_observed_at":"2026-08-16T04:24:01.207244Z","submitted_at":"2025-05-11T10:55:14Z","title":"Transformer-Based Dual-Optical Attention Fusion Crowd Head Point Counting and Localization Network","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T22:34:34.742232Z"},"links":{"citing_paper":"/paper/2505.06937"},"observation_digest":"sha256:ab24f124e32191324cfbb1feea51b398d5ac2f0f3c4a882128c43cf3d5dd8f8f","observation_id":"517e1f05-a438-4aff-9851-705ea69c7c10","resolution":{"observed_at":"2026-08-15T22:34:35.304932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11642","last_updated":"2024-09-18T02:14:08Z","snapshot_observed_at":"2026-08-16T13:17:39.329418Z","submitted_at":"2024-09-18T02:14:08Z","title":"DAF-Net: A Dual-Branch Feature Decomposition Fusion Network with Domain Adaptive for Infrared and Visible Image Fusion","version":1},"cited_work":{"arxiv_id":"2409.11642","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.11642","snapshot_observed_at":"2026-08-15T22:34:34.854216Z","title":"DAF-Net: A Dual-Branch Feature Decomposition Fusion Network with Domain Adaptive for Infrared and Visible Image Fusion","venue":"cs.CV","work_id":"92170046-64d6-4a21-a4c4-a80615ec0eb2","year":2024},"citing_paper":{"arxiv_id":"2505.06937","last_updated":"2025-05-11T10:55:14Z","snapshot_observed_at":"2026-08-16T04:24:01.207244Z","submitted_at":"2025-05-11T10:55:14Z","title":"Transformer-Based Dual-Optical Attention Fusion Crowd Head Point Counting and Localization Network","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T22:34:34.746249Z"},"links":{"cited_paper":"/paper/2409.11642","citing_paper":"/paper/2505.06937"},"observation_digest":"sha256:808f0a0992ff6c59cea7397df4a2cf68538c3ac6fa248fff5bf8153ae107676a","observation_id":"0eba9e58-877b-41bc-9d60-d5ec36c8f24e","resolution":{"observed_at":"2026-08-15T22:34:34.861251Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.12716","last_updated":"2022-07-05T00:41:41Z","snapshot_observed_at":"2026-08-16T18:36:53.356037Z","submitted_at":"2021-03-23T17:36:42Z","title":"UltraSR: Spatial Encoding is a Missing Key for Implicit Image Function-based Arbitrary-Scale Super-Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.12716","snapshot_observed_at":"2026-08-15T22:34:34.750425Z","title":"Ultrasr: Spatial encoding is a missing key for implicit image function-based arbitrary-scale super- resolution","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.06937","last_updated":"2025-05-11T10:55:14Z","snapshot_observed_at":"2026-08-16T04:24:01.207244Z","submitted_at":"2025-05-11T10:55:14Z","title":"Transformer-Based Dual-Optical Attention Fusion Crowd Head Point Counting and Localization Network","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T22:34:34.750425Z"},"links":{"cited_paper":"/paper/2103.12716","citing_paper":"/paper/2505.06937"},"observation_digest":"sha256:5256485e62f762c46963a5b20427cc97812267fd23c96ee3bd43710c08293e5c","observation_id":"5b31dd40-bf34-403e-992d-b002c2f8f1ee","resolution":{"observed_at":"2026-08-15T22:34:34.750425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:35.284822Z","title":"Baanet: Learning bi-directional adaptive attention gates for multispectral pedestrian detec- tion","venue":null,"work_id":"1b86a780-8140-41a9-9910-4c68734c63e5","year":2021},"citing_paper":{"arxiv_id":"2505.06937","last_updated":"2025-05-11T10:55:14Z","snapshot_observed_at":"2026-08-16T04:24:01.207244Z","submitted_at":"2025-05-11T10:55:14Z","title":"Transformer-Based Dual-Optical Attention Fusion Crowd Head Point Counting and Localization Network","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T22:34:34.754398Z"},"links":{"citing_paper":"/paper/2505.06937"},"observation_digest":"sha256:d0ef012115af9a69a35edc7f5498b6b11e63f3c00b72b1b647b885a48c70695f","observation_id":"c94f1d3f-f842-4fa5-bbec-e5756ae2a728","resolution":{"observed_at":"2026-08-15T22:34:35.289990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13801","last_updated":"2022-09-28T03:06:18Z","snapshot_observed_at":"2026-08-16T16:29:22.038176Z","submitted_at":"2022-09-28T03:06:18Z","title":"Translation, Scale and Rotation: Cross-Modal Alignment Meets RGB-Infrared Vehicle Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13801","snapshot_observed_at":"2026-08-15T22:34:34.758715Z","title":"Translation, scale and rotation: Cross-modal alignment meets rgb-infrared vehicle detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.06937","last_updated":"2025-05-11T10:55:14Z","snapshot_observed_at":"2026-08-16T04:24:01.207244Z","submitted_at":"2025-05-11T10:55:14Z","title":"Transformer-Based Dual-Optical Attention Fusion Crowd Head Point Counting and Localization Network","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T22:34:34.758715Z"},"links":{"cited_paper":"/paper/2209.13801","citing_paper":"/paper/2505.06937"},"observation_digest":"sha256:727551a0122eebdb8ccd535d179662bb72a90f706427ec1069f96d127bfae224","observation_id":"6cc6b4c2-6b3c-4d4f-9a54-459305437adf","resolution":{"observed_at":"2026-08-15T22:34:34.758715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:35.268550Z","title":"Improving rgb-infrared object detec- tion with cascade alignment-guided transformer.Inf","venue":null,"work_id":"1d3568e0-0dc7-4261-b489-33d6e2a2c3f2","year":2024},"citing_paper":{"arxiv_id":"2505.06937","last_updated":"2025-05-11T10:55:14Z","snapshot_observed_at":"2026-08-16T04:24:01.207244Z","submitted_at":"2025-05-11T10:55:14Z","title":"Transformer-Based Dual-Optical Attention Fusion Crowd Head Point Counting and Localization Network","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T22:34:34.763434Z"},"links":{"citing_paper":"/paper/2505.06937"},"observation_digest":"sha256:19362a69cb90254b8f3a0a5d35c621e38ab6ae30b95210e20142310f4933fb76","observation_id":"39653ad0-5e7a-4a37-9075-99518367f60e","resolution":{"observed_at":"2026-08-15T22:34:35.273845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:35.253231Z","title":"C²former: Calibrated and complementary transformer for rgb-infrared object de- tection","venue":null,"work_id":"e78f9743-d52d-40c2-95a1-deb265e568c6","year":2023},"citing_paper":{"arxiv_id":"2505.06937","last_updated":"2025-05-11T10:55:14Z","snapshot_observed_at":"2026-08-16T04:24:01.207244Z","submitted_at":"2025-05-11T10:55:14Z","title":"Transformer-Based Dual-Optical Attention Fusion Crowd Head Point Counting and Localization Network","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T22:34:34.767958Z"},"links":{"citing_paper":"/paper/2505.06937"},"observation_digest":"sha256:c9c93491801804ca89e3b997a62896b3d839231617b808bb18ee97d7609b9dd8","observation_id":"9423e08c-ea4f-491e-8cc1-7b0d80e6c9d5","resolution":{"observed_at":"2026-08-15T22:34:35.257487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:35.238622Z","title":"Weakly aligned feature fusion for mul- timodal object detection","venue":null,"work_id":"4c974784-1e57-47e2-b8ce-b5650b832daa","year":2021},"citing_paper":{"arxiv_id":"2505.06937","last_updated":"2025-05-11T10:55:14Z","snapshot_observed_at":"2026-08-16T04:24:01.207244Z","submitted_at":"2025-05-11T10:55:14Z","title":"Transformer-Based Dual-Optical Attention Fusion Crowd Head Point Counting and Localization Network","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T22:34:34.772239Z"},"links":{"citing_paper":"/paper/2505.06937"},"observation_digest":"sha256:0bdbd353c4f101eb967f8d15c3383f2cbd8028e938b8c84902d44e8807bda6ef","observation_id":"574c40bc-f2e2-4ba7-8790-4d1a41f2f5a1","resolution":{"observed_at":"2026-08-15T22:34:35.243033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:35.224138Z","title":"Single-image crowd counting via multi-column convolutional neural network","venue":null,"work_id":"aa32dd4f-a637-4e5a-b70d-e626b80be850","year":2016},"citing_paper":{"arxiv_id":"2505.06937","last_updated":"2025-05-11T10:55:14Z","snapshot_observed_at":"2026-08-16T04:24:01.207244Z","submitted_at":"2025-05-11T10:55:14Z","title":"Transformer-Based Dual-Optical Attention Fusion Crowd Head Point Counting and Localization Network","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T22:34:34.776588Z"},"links":{"citing_paper":"/paper/2505.06937"},"observation_digest":"sha256:3a10aba254be70cc7090b5e613e9d9b5d076b82752947864e5f64e14c9ae2b40","observation_id":"301ca891-f08d-4530-8197-d0b945a83aad","resolution":{"observed_at":"2026-08-15T22:34:35.228470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:35.208564Z","title":"Improving multispectral pedestrian detection by addressing modality imbalance problems","venue":null,"work_id":"dd51d159-a185-442a-9055-14e6f3a16c9b","year":2020},"citing_paper":{"arxiv_id":"2505.06937","last_updated":"2025-05-11T10:55:14Z","snapshot_observed_at":"2026-08-16T04:24:01.207244Z","submitted_at":"2025-05-11T10:55:14Z","title":"Transformer-Based Dual-Optical Attention Fusion Crowd Head Point Counting and Localization Network","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T22:34:34.780972Z"},"links":{"citing_paper":"/paper/2505.06937"},"observation_digest":"sha256:ff69417689b40fea6013dd2895b0315d08b20dc72c8be96987f67ddc9ac0b250","observation_id":"a06f6b2f-fdc4-4c78-a923-790331b20307","resolution":{"observed_at":"2026-08-15T22:34:35.213773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:34:35.193513Z","title":null,"venue":null,"work_id":"05000a85-2b0f-4fbe-9997-4ee0d6b4b525","year":2023},"citing_paper":{"arxiv_id":"2505.06937","last_updated":"2025-05-11T10:55:14Z","snapshot_observed_at":"2026-08-16T04:24:01.207244Z","submitted_at":"2025-05-11T10:55:14Z","title":"Transformer-Based Dual-Optical Attention Fusion Crowd Head Point Counting and Localization Network","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T22:34:34.785560Z"},"links":{"citing_paper":"/paper/2505.06937"},"observation_digest":"sha256:d071ffe3f609e675d33ac6d17b9d7fd2a6634e146fcc759be544c14123a33cd4","observation_id":"b253eb47-caac-4d57-9c59-355b0cf1edcf","resolution":{"observed_at":"2026-08-15T22:34:35.198082Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.06937","last_updated":"2025-05-11T10:55:14Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T04:24:01.207244Z","submitted_at":"2025-05-11T10:55:14Z","title":"Transformer-Based Dual-Optical Attention Fusion Crowd Head Point Counting and Localization Network"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":3,"verified_fuzzy":33},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:2505.06937."}