{"as_of":"2026-08-12T10:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b0546fda31fe123010899c2a3b304af59efdb7d5d646cf586c0a3b47c85b5d82","coverage":[{"denominator":117,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T19:33:09.159780Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T16:30:19.100173Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T16:30:19.157894Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"cited_work":{"arxiv_id":"2412.06674","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.06674","snapshot_observed_at":"2026-08-05T16:30:19.157894Z","title":"EMOv2: Pushing 5M Vision Model Frontier","venue":"cs.CV","work_id":"0dd84e20-df9b-4559-bf97-6739227e29d0","year":2024},"citing_paper":{"arxiv_id":"2508.18445","last_updated":"2025-08-25T19:48:52Z","snapshot_observed_at":"2026-08-05T16:30:15.820197Z","submitted_at":"2025-08-25T19:48:52Z","title":"VQualA 2025 Challenge on Face Image Quality Assessment: Methods and Results","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T16:30:19.100173Z"},"links":{"cited_paper":"/paper/2412.06674","citing_paper":"/paper/2508.18445"},"observation_digest":"sha256:7f9f7328533a2a892a9839e2b53d9db9e557ccf11f354435c7d66189e74ff15a","observation_id":"fd592c2d-bfac-4ee6-98bc-6e25b4ba6797","resolution":{"observed_at":"2026-08-05T16:30:19.165100Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.06674/citation-record","integrity":"/paper/2412.06674/integrity","json":"/paper/2412.06674/citation-record.json","paper":"/paper/2412.06674"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:08.654918Z","title":"Rethinking vision transformers for mobilenet size and speed,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.654918Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:deb0be5a140cc2681631865c0da1278d10992212b19383092774c70420e02159","observation_id":"8e84cf61-7c8c-40c1-a18e-8b065172ec78","resolution":{"observed_at":"2026-08-11T19:33:08.654918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:08.661571Z","title":"Edgenext: efficiently amalgamated cnn-transformer architecture for mobile vision applications,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.661571Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:4ac0f3140136634dea3e4a08072183208b11dd3b23cb5fc877ee9e2fc8f8fd28","observation_id":"73934214-ad02-419b-9ea6-953354eb7b0d","resolution":{"observed_at":"2026-08-11T19:33:08.661571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13789","last_updated":"2025-01-08T10:01:20Z","snapshot_observed_at":"2026-07-06T17:06:29.162729Z","submitted_at":"2023-12-21T12:26:11Z","title":"TinySAM: Pushing the Envelope for Efficient Segment Anything Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13789","snapshot_observed_at":"2026-08-11T19:33:08.666958Z","title":"Tinysam: Pushing the envelope for efficient segment anything model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.666958Z"},"links":{"cited_paper":"/paper/2312.13789","citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:1b07dbd6405e33df145fd0a46fc46101871610a492adfe724af28ff10bdace94","observation_id":"411ff54c-7915-4fda-8451-f04aa6e20fc8","resolution":{"observed_at":"2026-08-11T19:33:08.666958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06660","last_updated":"2025-09-07T19:09:41Z","snapshot_observed_at":"2026-08-12T04:34:46.744650Z","submitted_at":"2023-12-11T18:59:52Z","title":"EdgeSAM: Prompt-In-the-Loop Distillation for SAM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06660","snapshot_observed_at":"2026-08-11T19:33:08.673378Z","title":"Edgesam: Prompt-in-the- loop distillation for on-device deployment of sam,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.673378Z"},"links":{"cited_paper":"/paper/2312.06660","citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:05c6055e328036774097b99c1a5bf53c491da23d32873e41341e7fe813242c35","observation_id":"7e58ad30-8e85-455e-8d61-0653dc7ac474","resolution":{"observed_at":"2026-08-11T19:33:08.673378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10228","last_updated":"2025-02-28T01:54:23Z","snapshot_observed_at":"2026-08-09T23:35:14.322392Z","submitted_at":"2024-01-18T18:59:30Z","title":"RMP-SAM: Towards Real-Time Multi-Purpose Segment Anything","version":2},"cited_work":{"arxiv_id":"2401.10228","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.10228","snapshot_observed_at":"2026-08-11T19:33:09.924206Z","title":"RMP-SAM: Towards Real-Time Multi-Purpose Segment Anything","venue":"cs.CV","work_id":"7e554d3a-3f0a-4a79-99bd-f219f6e211c5","year":2024},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.678897Z"},"links":{"cited_paper":"/paper/2401.10228","citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:f679c3b34bb26b05ccdd990772412f1b555cdfdeb99f220c1c342a2be4ae304b","observation_id":"4626c645-2d66-4f12-8eb1-3f575496e272","resolution":{"observed_at":"2026-08-11T19:33:09.930388Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:08.684783Z","title":"Semantic flow for fast and accurate scene parsing,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.684783Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:a586d91ad3f57d2fc9600fbeb9f460c48da10d2c0499d50c212795d549f96f1e","observation_id":"f4a81fa6-25d5-402f-a38b-0421641e9c6a","resolution":{"observed_at":"2026-08-11T19:33:08.684783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:08.691436Z","title":"RTMO: Towards high-performance one-stage real-time multi-person pose estimation,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.691436Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:afb1beecb0775531ef1361401e9e03c6109e30ba415d85495038c39eb1f43e9e","observation_id":"be0314c3-7ad2-4c6c-bef4-ff62ad9c4b8f","resolution":{"observed_at":"2026-08-11T19:33:08.691436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.04861","last_updated":"2017-04-17T03:57:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-04-17T03:57:34Z","title":"MobileNets: Efficient Convolutional Neural Networks for Mobile Vision Applications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.04861","snapshot_observed_at":"2026-08-11T19:33:08.696530Z","title":"Mobilenets: Efficient convolu- tional neural networks for mobile vision applications,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.696530Z"},"links":{"cited_paper":"/paper/1704.04861","citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:d5f82a82a8f8e14c6dc6f4c95b1ad607097379406c9cf183446afff51c36da44","observation_id":"c7ad3ff9-e6ec-404f-a405-d69773bf8967","resolution":{"observed_at":"2026-08-11T19:33:08.696530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:08.701456Z","title":"Mobilenetv2: Inverted residuals and linear bottlenecks,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.701456Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:38ed7f19224db321a63ee72685f474ae40a0d696a40c8c6a17927c781d5be26d","observation_id":"c3b56807-9f23-4947-a900-903807f3d1ea","resolution":{"observed_at":"2026-08-11T19:33:08.701456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:08.706363Z","title":"Searching for mobilenetv3,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.706363Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:06dcac6d1c8c6d9669f5ef13dd9cc33432495b974cd61f5c0cc3801da73a0ee3","observation_id":"1ffe787f-beb9-42a5-a433-f44eaf2ffbdf","resolution":{"observed_at":"2026-08-11T19:33:08.706363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:08.711971Z","title":"Ghostnet: More features from cheap operations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.711971Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:16765d22b6b316b6dceb56d9d877c4871fbe86719dbac597a0d0980d08baf27a","observation_id":"c715fc29-f051-455c-a572-bde4120ccf4c","resolution":{"observed_at":"2026-08-11T19:33:08.711971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:08.717647Z","title":"Efficientnet: Rethinking model scaling for convolu- tional neural networks,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.717647Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:f05d463f43faf6773f8ea324e54cdeb0a3805350294f71ea8230e8412663a14c","observation_id":"8ac428f7-739d-4c7f-8c21-da27321d5c9d","resolution":{"observed_at":"2026-08-11T19:33:08.717647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:08.723263Z","title":"Rethinking mobile block for efficient attention- based models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.723263Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:ea4632b80c08263f9807060abb3e629a0e8b1c01179c1c0f9951912a46612823","observation_id":"abbfe0d3-ec84-4b43-bed4-8b2cb3d7107b","resolution":{"observed_at":"2026-08-11T19:33:08.723263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:08.727666Z","title":"Separable self-attention for mobile vision transformers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.727666Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:0aa4d17492a2e77ed1b508f3d9fac787a47498716818c8ceef2a864ca13fc80e","observation_id":"7ab1bf7e-2601-4303-8c09-96d2f1a3c2f2","resolution":{"observed_at":"2026-08-11T19:33:08.727666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:08.731853Z","title":"The need for speed in ai,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.731853Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:7bb3d5f4b01ab4d8a2ac667783152a25552ee5017a2e9cb3487e894639d84e2e","observation_id":"0990dfa0-8335-417b-9287-aff0f9e29755","resolution":{"observed_at":"2026-08-11T19:33:08.731853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:08.736200Z","title":"Morgan Kaufmann, 1994","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.736200Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:10282927871bbb4b9ef6bd163563b2465fd90bda7cb4e733ff5752c625270f40","observation_id":"36848301-9378-4db7-abfe-9730811e6041","resolution":{"observed_at":"2026-08-11T19:33:08.736200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:08.741940Z","title":"Mobilevit: Light-weight, general-purpose, and mobile-friendly vision transformer,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.741940Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:fed08e9a4a51f5645a1212ce69388a1dccf90e640d5e0f56f5b1983f374b15de","observation_id":"70f6f7a5-ae5c-43b7-9ad6-fb4e2ae1207a","resolution":{"observed_at":"2026-08-11T19:33:08.741940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:08.747913Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.747913Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:bca8d457e19773cb4cb56bd5135cbef4205cc48d9d0ac92185156278ae171025","observation_id":"e00b2a56-e6d6-4f7d-aa3b-3f0cdebdf639","resolution":{"observed_at":"2026-08-11T19:33:08.747913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:08.752576Z","title":"Pyramid vision transformer: A versatile backbone for dense prediction without convolutions,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.752576Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:cca9ea4b31e96ea846ebf7d64e1b3473f4b00cdf3bc322ceb4de0066f82acda8","observation_id":"3158886e-6a80-4b9c-b34d-ba2450d64983","resolution":{"observed_at":"2026-08-11T19:33:08.752576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:08.757577Z","title":"Pvt v2: Improved baselines with pyramid vision transformer,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.757577Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:7a1019bc1cda803d41dffc8779547a79d68bd4d95534a5026b9675ab8257ef29","observation_id":"c4a2ca76-9dc6-49f7-b599-2c84ec0deab5","resolution":{"observed_at":"2026-08-11T19:33:08.757577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:08.761844Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.761844Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:bf6ebc6ba3936d07f2a86b5a9771a6fe35d198e9846de82ec10914ac2646b197","observation_id":"a8be071b-6bba-4e0e-a390-252fdd28640a","resolution":{"observed_at":"2026-08-11T19:33:08.761844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:08.766281Z","title":"Swin transformer v2: Scaling up capacity and resolution,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.766281Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:95739f49edc341aa1c1c34a4e72af55c23e513203d653c07fb59ecf1d6c9ccd6","observation_id":"acd20323-67f1-4521-8e2b-b175589b0b70","resolution":{"observed_at":"2026-08-11T19:33:08.766281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:08.770568Z","title":"Analogous to evolutionary algorithm: Designing a unified sequence model,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.770568Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:8b68f126a3363aee730d8454480106c1154d52a236323cee9677f14e213f38cb","observation_id":"f755c53c-fc13-49d4-8fa3-ed7c03243643","resolution":{"observed_at":"2026-08-11T19:33:08.770568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:08.774881Z","title":"Eatformer: improving vision transformer inspired by evolutionary algorithm,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.774881Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:f6860172adfba106b88994e6decdb6d432efa895f959a52d4ac6b45f75e6e166","observation_id":"ff6ec03f-1536-42c6-9abe-77e2a5d307c0","resolution":{"observed_at":"2026-08-11T19:33:08.774881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:08.779095Z","title":"Transformer-based visual segmentation: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.779095Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:f133b2041babe3cd5e7b6291caf0e14fc7facd55dbfe25c0e9b43ea36929756f","observation_id":"f65a7298-ff7b-40a5-8b96-24dabe04e7b0","resolution":{"observed_at":"2026-08-11T19:33:08.779095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:08.784290Z","title":"Involution: Inverting the inherence of convolution for visual recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.784290Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:c91e21663bf548817a05f499f00460040b2dd6a8a2d8d63c4ba91c2cda478636","observation_id":"1d98f55a-1abc-47b8-be2e-842544e36605","resolution":{"observed_at":"2026-08-11T19:33:08.784290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:08.789159Z","title":"Reformer: The efficient transformer,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.789159Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:8650b1bf79fb7f25679a113cb4d876067b7df545d48628896abb57f1348e62b8","observation_id":"fd42233a-f80b-49f1-b593-17445f5468d1","resolution":{"observed_at":"2026-08-11T19:33:08.789159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:08.793762Z","title":"Rethinking attention with performers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.793762Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:0bdf2cb90b4d0de8b7b88352daa56364197e828096d4d0258eafcd715dbefd52","observation_id":"34e7f7c7-731d-4326-ba20-9dff7667a4df","resolution":{"observed_at":"2026-08-11T19:33:08.793762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:08.799084Z","title":"Cvt: Introducing convolutions to vision transformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.799084Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:c3e0fc1f96b007e7596ba3ed9b18d5ce548d5ad5c26fd966076f266925aa7b4a","observation_id":"27bd2904-f201-4682-921f-3896a3aad547","resolution":{"observed_at":"2026-08-11T19:33:08.799084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05501","last_updated":"2022-08-16T10:16:20Z","snapshot_observed_at":"2026-07-06T13:30:21.406367Z","submitted_at":"2022-07-12T12:50:34Z","title":"Next-ViT: Next Generation Vision Transformer for Efficient Deployment in Realistic Industrial Scenarios","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05501","snapshot_observed_at":"2026-08-11T19:33:08.804743Z","title":"Next-vit: Next generation vision transformer for efficient deploy- ment in realistic industrial scenarios,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.804743Z"},"links":{"cited_paper":"/paper/2207.05501","citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:0b4e72cae968f585bf7956d2cc72239e06b226b23d7c80d3ad1b87e691fe121e","observation_id":"e5eb6ccc-8c74-492c-b035-4c28345ed52e","resolution":{"observed_at":"2026-08-11T19:33:08.804743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:08.810047Z","title":"Delight: Deep and light-weight transformer,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.810047Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:bd9930119fd06baa3fee85c1715304b364eef822e2a71d2e0ff95f092db443a2","observation_id":"afe24a19-3941-4870-95cd-d62da4f76f0f","resolution":{"observed_at":"2026-08-11T19:33:08.810047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15159","last_updated":"2022-10-06T14:19:13Z","snapshot_observed_at":"2026-07-06T13:58:02.046343Z","submitted_at":"2022-09-30T01:04:10Z","title":"MobileViTv3: Mobile-Friendly Vision Transformer with Simple and Effective Fusion of Local, Global and Input Features","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15159","snapshot_observed_at":"2026-08-11T19:33:08.814498Z","title":"Mobilevitv3: Mobile-friendly vision transformer with simple and effective fusion of local, global and input features,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.814498Z"},"links":{"cited_paper":"/paper/2209.15159","citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:fcb08892a43625c1edc043bca34f5f5094a718925913cea7562620338904312d","observation_id":"992e5d3b-2184-4fd1-94de-0a93dfc5beb2","resolution":{"observed_at":"2026-08-11T19:33:08.814498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:08.820780Z","title":"Mobile-former: Bridging mobilenet and transformer,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.820780Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:465dd534786d25f1144bbabf308d379550de138de38fda78c0d5658418e066bf","observation_id":"e520eb0b-6d36-4c8f-86c3-bcb393c5ea46","resolution":{"observed_at":"2026-08-11T19:33:08.820780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:08.827247Z","title":"Efficientformer: Vision transformers at mobilenet speed,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.827247Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:de6fa3b7a94ab9ae3d2a2bfeefa021958aa337d2cf41b969e83e46a436ca8505","observation_id":"03f0c357-36fa-4f03-ada7-af4d35b2fa63","resolution":{"observed_at":"2026-08-11T19:33:08.827247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:08.833265Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.833265Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:5b7810452ebd8891c2104735251d01b2ee072479cf9043931296c96b180e3c42","observation_id":"58c51e32-7a46-4087-80c5-8b3e216cc763","resolution":{"observed_at":"2026-08-11T19:33:08.833265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:08.839656Z","title":"Focal loss for dense object detection,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.839656Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:ffbbe36c81bbb4353905ae6e1897faaaae06d37787e73fbba01548680d61314b","observation_id":"392d599a-51f6-4ae9-b3fa-f39d0fa02526","resolution":{"observed_at":"2026-08-11T19:33:08.839656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.07360","last_updated":"2016-11-04T21:26:08Z","snapshot_observed_at":"2026-07-06T04:47:10.710916Z","submitted_at":"2016-02-24T00:09:45Z","title":"SqueezeNet: AlexNet-level accuracy with 50x fewer parameters and <0.5MB model size","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.07360","snapshot_observed_at":"2026-08-11T19:33:08.845432Z","title":"Squeezenet: Alexnet-level accuracy with 50x fewer parameters and< 0.5 mb model size,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.845432Z"},"links":{"cited_paper":"/paper/1602.07360","citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:64e33217593c1647e3513c998bae3b6578d4921eb67a212b5ec4578ef057199d","observation_id":"55a4544f-fa93-43c1-8266-15eec9444fc9","resolution":{"observed_at":"2026-08-11T19:33:08.845432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:08.851325Z","title":"Rethinking the inception architecture for computer vision,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.851325Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:3cd0f47837cc7639e9536e72c7db6c3270132ae27889aec90217d2aeeb8f7305","observation_id":"8a1d4f5b-bc96-480f-aa03-d4e603c7c3ad","resolution":{"observed_at":"2026-08-11T19:33:08.851325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:08.858186Z","title":"Sfnet: Faster, accurate, and domain agnostic semantic segmentation via semantic flow,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.858186Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:be41df7a5affea188624fda1e9b0cfb4e6528af315d474f26396330300ff4003","observation_id":"486bcff3-5a35-4f06-9161-707ae2c96535","resolution":{"observed_at":"2026-08-11T19:33:08.858186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09283","last_updated":"2024-03-14T08:28:13Z","snapshot_observed_at":"2026-07-06T15:55:21.408850Z","submitted_at":"2023-07-18T14:24:33Z","title":"RepViT: Revisiting Mobile CNN From ViT Perspective","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09283","snapshot_observed_at":"2026-08-11T19:33:08.863249Z","title":"Repvit: Revis- iting mobile cnn from vit perspective. arxiv 2023,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.863249Z"},"links":{"cited_paper":"/paper/2307.09283","citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:68bfdd61aea02e16fa72231dfa396e26da5a06c1e70b11f736cb36b429ad2012","observation_id":"8ff64f92-79ed-4bd1-8890-cc59de2db743","resolution":{"observed_at":"2026-08-11T19:33:08.863249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11202","last_updated":"2024-04-22T02:46:44Z","snapshot_observed_at":"2026-08-10T23:34:09.511886Z","submitted_at":"2024-04-17T09:33:31Z","title":"GhostNetV3: Exploring the Training Strategies for Compact Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11202","snapshot_observed_at":"2026-08-11T19:33:08.868843Z","title":"Ghostnetv3: Ex- ploring the training strategies for compact models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.868843Z"},"links":{"cited_paper":"/paper/2404.11202","citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:0020bbe7c1ebba1f89b916863d0f1c546690b68d4a0507a8570ddcf69c360ad5","observation_id":"9a640a60-d755-402b-9f9c-619af5ab2cac","resolution":{"observed_at":"2026-08-11T19:33:08.868843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10518","last_updated":"2024-09-29T21:58:22Z","snapshot_observed_at":"2026-08-05T00:57:12.473863Z","submitted_at":"2024-04-16T12:41:25Z","title":"MobileNetV4 -- Universal Models for the Mobile Ecosystem","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10518","snapshot_observed_at":"2026-08-11T19:33:08.873961Z","title":"Mobilenetv4-universal models for the mobile ecosystem,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.873961Z"},"links":{"cited_paper":"/paper/2404.10518","citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:418ce6acd34babbc2a303531a8fb055460bd6d35b9ccf59831d0cc0568cd6c36","observation_id":"4e6f82c6-2a2c-41ae-ad0e-3b70f686dfae","resolution":{"observed_at":"2026-08-11T19:33:08.873961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:08.879036Z","title":"Training data-efficient image transformers & distillation through attention,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.879036Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:b813814662cd94e335553f94534d1cb6c5487d12220659c9e7192b61c86a2331","observation_id":"c377e4c1-abe1-44de-8b56-044a72afed09","resolution":{"observed_at":"2026-08-11T19:33:08.879036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:08.883318Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.883318Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:3def40e5d422624fed53d8f1bde885999074c86f8500cfff8607e17e3a307018","observation_id":"1955f161-b3e5-4173-9c88-c9e2ac5f9627","resolution":{"observed_at":"2026-08-11T19:33:08.883318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.07756","last_updated":"2024-05-05T18:44:14Z","snapshot_observed_at":"2026-07-06T13:00:53.618234Z","submitted_at":"2022-04-16T08:57:00Z","title":"Visual Attention Methods in Deep Learning: An In-Depth Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.07756","snapshot_observed_at":"2026-08-11T19:33:08.887397Z","title":"Visual attention methods in deep learning: An in-depth survey,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.887397Z"},"links":{"cited_paper":"/paper/2204.07756","citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:cd38118905907fc30fe412b0a83001984b58c087b6e63a31d5dd905d81df42aa","observation_id":"32ea3e88-d033-46fa-975a-85b102a9e5fb","resolution":{"observed_at":"2026-08-11T19:33:08.887397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.01536","last_updated":"2023-10-17T06:05:41Z","snapshot_observed_at":"2026-08-12T06:23:35.761889Z","submitted_at":"2022-03-03T06:17:03Z","title":"Recent Advances in Vision Transformer: A Survey and Outlook of Recent Work","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.01536","snapshot_observed_at":"2026-08-11T19:33:08.892005Z","title":"Recent advances in vision transformer: A survey and outlook of recent work,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.892005Z"},"links":{"cited_paper":"/paper/2203.01536","citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:3a9face825804e9b4a8a8266de28c9a88338eec1cd46dac2dfbfebfe4bd74148","observation_id":"743ef52e-aec7-42fd-ac69-d156a532d765","resolution":{"observed_at":"2026-08-11T19:33:08.892005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:08.896971Z","title":"Incorporating convolution designs into visual transformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.896971Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:6a02c56092458f859edc3fa3c96ef11428ae8f259481bcdd1c2ee06296ebf38c","observation_id":"cbc42525-401c-4862-83c6-7dea658736a9","resolution":{"observed_at":"2026-08-11T19:33:08.896971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:08.901253Z","title":"Conditional positional encodings for vision transformers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.901253Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:a400429df7b7c8e46f6a051e36a57adbb4e3b9c51ddd865d94a9a0e5eb0330ad","observation_id":"2f21b8c0-dc0a-4499-9607-3048338d7061","resolution":{"observed_at":"2026-08-11T19:33:08.901253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:08.905345Z","title":"Uniformer: Unified transformer for efficient spatial-temporal representation learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.905345Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:6ed5088c74bb95f1c3d2a6a98254854a3945221e7056c5ce3f1c150b18b9bc42","observation_id":"b0aaec46-3205-4273-81c5-603398431aca","resolution":{"observed_at":"2026-08-11T19:33:08.905345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:11.109302Z","title":"Moganet: Multi-order gated aggregation network,","venue":null,"work_id":"7f42ae5a-f7e7-41c2-ab02-b221421411b1","year":null},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.909672Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:96f9f8a7aa3fea40aeebfe43f3f4d1167cf51035bce63a3f549b7ab48bbf4347","observation_id":"efbbadd6-3bd9-46c9-8526-31080f65c0c0","resolution":{"observed_at":"2026-08-11T19:33:11.116756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:11.090160Z","title":"Shvit: Single-head vision transformer with memory efficient macro design,","venue":null,"work_id":"cc3a9bfe-f4ac-4ba3-a99a-ccf48fd52931","year":2024},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.914141Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:bfe9552334cd9017389e2bd4b2c0ea3e5f3de50e00e5b4aa2cb094dcd0822d20","observation_id":"1397ff16-5ff2-4ee2-a7c3-2b64b661da38","resolution":{"observed_at":"2026-08-11T19:33:11.096081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:11.069018Z","title":"Metaformer is actually what you need for vision,","venue":null,"work_id":"26061b94-07be-4add-8cac-813e6887cf05","year":2022},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.919166Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:b0b1ef72e75ddc32c9c580b264996c0675b341ccfbbcfd581b5eb6a0b789a0ab","observation_id":"47747279-bde4-4292-a45e-1dcd761b2e6d","resolution":{"observed_at":"2026-08-11T19:33:11.076066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05557","last_updated":"2022-07-12T14:27:57Z","snapshot_observed_at":"2026-07-06T13:30:25.055070Z","submitted_at":"2022-07-12T14:27:57Z","title":"LightViT: Towards Light-Weight Convolution-Free Vision Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05557","snapshot_observed_at":"2026-08-11T19:33:08.925512Z","title":"Lightvit: To- wards light-weight convolution-free vision transformers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.925512Z"},"links":{"cited_paper":"/paper/2207.05557","citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:d68b21b72ab5fe19206220dd714748dd2c8d0766ed112657858328220d4d187e","observation_id":"43aac6a7-d236-42b7-b7e6-7525849696e0","resolution":{"observed_at":"2026-08-11T19:33:08.925512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:11.040154Z","title":"Rest: An efficient transformer for visual recognition,","venue":null,"work_id":"9af9dee8-9971-4401-9436-ab10d2700356","year":2021},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.931911Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:dab00a7f3552a538896187ce2df40afda59f7483d23d8214f65d0414ba422be0","observation_id":"27f40d56-3242-48a8-8afc-9e3be376ecb0","resolution":{"observed_at":"2026-08-11T19:33:11.048115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:11.018899Z","title":"Edgevits: Competing light-weight cnns on mobile devices with vision transformers,","venue":null,"work_id":"8e8d124c-79f7-42e4-ab77-4bc170424fb0","year":2022},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.936398Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:e807d446a5a77e453eaf0f149a48d029ec40bc484df816dd9728436e55ac8d59","observation_id":"c917cc1b-f326-4ddd-928b-77f635b36e8b","resolution":{"observed_at":"2026-08-11T19:33:11.025015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:10.999838Z","title":"Res2net: A new multi-scale backbone architecture,","venue":null,"work_id":"fd6f1d73-c0d2-42af-9471-3d2fc8e86992","year":2019},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.941031Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:45f72a9d2eb2151185e226ce56444d45588308948611c7324de2705ee4cdbc91","observation_id":"e2d96dbe-2661-4e47-baf4-d231bb7d05f0","resolution":{"observed_at":"2026-08-11T19:33:11.005459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:10.981264Z","title":"Xcit: Cross- covariance image transformers,","venue":null,"work_id":"4b843621-7d66-4180-8ce6-217b60a9daf5","year":2021},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.945517Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:fab7004e028bd049727b9337b98a3de27485a8f98953b269e8758376966e7f6e","observation_id":"a1f46c91-27f5-495c-99de-d53d18a39504","resolution":{"observed_at":"2026-08-11T19:33:10.986956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18425","last_updated":"2024-05-29T02:06:30Z","snapshot_observed_at":"2026-08-03T19:52:23.169593Z","submitted_at":"2024-05-28T17:59:21Z","title":"ViG: Linear-complexity Visual Sequence Learning with Gated Linear Attention","version":2},"cited_work":{"arxiv_id":"2405.18425","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.18425","snapshot_observed_at":"2026-08-11T19:33:09.670161Z","title":"ViG: Linear-complexity Visual Sequence Learning with Gated Linear Attention","venue":"cs.CV","work_id":"ed2d6f97-4a78-4e11-b969-f85b7a39cb0e","year":2024},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.950493Z"},"links":{"cited_paper":"/paper/2405.18425","citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:5ca1f64f38d395d82e655061e668165d6ee0316ea501aab2124328852d540172","observation_id":"a92d1563-4dab-4dfd-97dd-790e49f0ba0c","resolution":{"observed_at":"2026-08-11T19:33:09.678654Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15214","last_updated":"2024-09-03T06:40:37Z","snapshot_observed_at":"2026-08-04T15:08:02.124307Z","submitted_at":"2024-05-24T05:02:51Z","title":"PointRWKV: Efficient RWKV-Like Model for Hierarchical Point Cloud Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15214","snapshot_observed_at":"2026-08-11T19:33:08.955174Z","title":"Pointrwkv: Efficient rwkv-like model for hierarchical point cloud learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.955174Z"},"links":{"cited_paper":"/paper/2405.15214","citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:5ae105f20acec02d9831ec1ff4fc054bbf67eaf63d619d3371ab45ccd92cbd7e","observation_id":"a4a37822-38fa-4b5a-acb1-e31952461ee9","resolution":{"observed_at":"2026-08-11T19:33:08.955174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02308","last_updated":"2025-03-31T06:14:48Z","snapshot_observed_at":"2026-08-10T09:03:08.430176Z","submitted_at":"2024-03-04T18:46:20Z","title":"Vision-RWKV: Efficient and Scalable Visual Perception with RWKV-Like Architectures","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02308","snapshot_observed_at":"2026-08-11T19:33:08.960085Z","title":"Vision-rwkv: Efficient and scalable visual perception with rwkv-like architectures,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.960085Z"},"links":{"cited_paper":"/paper/2403.02308","citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:eb401f1bb0d394031075c40160e35341e791abe76059f7cbb1828944dc73cbc4","observation_id":"a479897f-bf53-4400-a6e2-ada955ad23ca","resolution":{"observed_at":"2026-08-11T19:33:08.960085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19369","last_updated":"2024-06-27T17:49:25Z","snapshot_observed_at":"2026-07-06T18:38:05.229292Z","submitted_at":"2024-06-27T17:49:25Z","title":"Mamba or RWKV: Exploring High-Quality and High-Efficiency Segment Anything Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19369","snapshot_observed_at":"2026-08-11T19:33:08.964841Z","title":"Mamba or rwkv: Exploring high-quality and high-efficiency segment anything model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.964841Z"},"links":{"cited_paper":"/paper/2406.19369","citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:c65d8ced735cd7c70b3b1e005319ea740e76f06877c54fbe90c055dac2085d6d","observation_id":"17fad12d-aff0-499a-b5e7-59f97270620c","resolution":{"observed_at":"2026-08-11T19:33:08.964841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-11T19:33:08.969473Z","title":"Mamba: Linear-time sequence modeling with selective state spaces,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.969473Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:4e100f5b65b7af057a4e311d432eda5c8f445e2521faeb8c64239e9398325e22","observation_id":"846bddbb-113b-45fe-8c27-736174fb5682","resolution":{"observed_at":"2026-08-11T19:33:08.969473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13048","last_updated":"2023-12-11T03:58:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T13:57:41Z","title":"RWKV: Reinventing RNNs for the Transformer Era","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13048","snapshot_observed_at":"2026-08-11T19:33:08.974566Z","title":"Rwkv: Reinventing rnns for the transformer era,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.974566Z"},"links":{"cited_paper":"/paper/2305.13048","citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:0a23b41f86575b9e2ff9e1519f6e9173790485076d24dd815ff1bb320e6dcb56","observation_id":"17db84ff-8a86-4532-9a30-958bf9e1c72a","resolution":{"observed_at":"2026-08-11T19:33:08.974566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09417","last_updated":"2024-11-14T02:00:33Z","snapshot_observed_at":"2026-07-06T17:16:59.193820Z","submitted_at":"2024-01-17T18:56:18Z","title":"Vision Mamba: Efficient Visual Representation Learning with Bidirectional State Space Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09417","snapshot_observed_at":"2026-08-11T19:33:08.979919Z","title":"Vision mamba: Efficient visual representation learning with bidirectional state space model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.979919Z"},"links":{"cited_paper":"/paper/2401.09417","citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:2dc7ad653207f833afa1359cf14812dfac785b2ede1043ee314aa78c0d285b9d","observation_id":"cecb269c-59f2-46ad-b5ee-234fec159eaa","resolution":{"observed_at":"2026-08-11T19:33:08.979919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09977","last_updated":"2024-03-15T02:48:47Z","snapshot_observed_at":"2026-08-06T17:16:43.748086Z","submitted_at":"2024-03-15T02:48:47Z","title":"EfficientVMamba: Atrous Selective Scan for Light Weight Visual Mamba","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09977","snapshot_observed_at":"2026-08-11T19:33:08.985119Z","title":"Efficientvmamba: Atrous selective scan for light weight visual mamba,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.985119Z"},"links":{"cited_paper":"/paper/2403.09977","citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:50fdaa7c9c1401401c477d6fde95d1f9c45f6596201bd2290845685663326e76","observation_id":"f113bcfd-9f82-42a5-a765-b1fedf2ac45c","resolution":{"observed_at":"2026-08-11T19:33:08.985119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15941","last_updated":"2024-11-24T18:01:05Z","snapshot_observed_at":"2026-08-09T21:06:41.270816Z","submitted_at":"2024-11-24T18:01:05Z","title":"MobileMamba: Lightweight Multi-Receptive Visual Mamba Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15941","snapshot_observed_at":"2026-08-11T19:33:08.990933Z","title":"Mobilemamba: Lightweight multi-receptive visual mamba network,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.990933Z"},"links":{"cited_paper":"/paper/2411.15941","citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:da8c537e7ded924dd5c9e3832cdab8f1a4a1e46b2dbbb055c0166a056cedb15c","observation_id":"ca7ddef0-e575-4101-a4b6-35eb9fb6ce84","resolution":{"observed_at":"2026-08-11T19:33:08.990933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:10.963035Z","title":"Scalable diffusion models with transformers,","venue":null,"work_id":"d81c1a5b-d5cc-41a5-b43b-0ce97aa13d84","year":2023},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:08.996411Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:36d8f8376dc8b0c8140d3f1e51038a9d9e7027e9e2445439398384080ffac302","observation_id":"d5be2b96-5ac2-42ea-bd25-a18e90e94b8a","resolution":{"observed_at":"2026-08-11T19:33:10.969001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:10.944703Z","title":"Focal attention for long-range interactions in vision transformers,","venue":null,"work_id":"9ce0e99b-51e6-48fb-bcf3-cd9989eb3239","year":null},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:09.002489Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:b514ce77578b12a57030a5f003d7e7122f53dbd003f485b319e8d0a4429ff539","observation_id":"dd7ee496-e397-4116-8610-07581aeae030","resolution":{"observed_at":"2026-08-11T19:33:10.950398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:10.918305Z","title":"Cswin transformer: A general vision transformer backbone with cross-shaped windows,","venue":null,"work_id":"034506ab-172a-4993-92bf-393b321aeaf5","year":2022},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:09.008272Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:8fbb72a599f61c3dbcd43633f4a01c801cc33e885a23621e24902bd9eb7044bf","observation_id":"e62db3f7-e045-4f42-b810-cd7277157d9b","resolution":{"observed_at":"2026-08-11T19:33:10.928923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:10.897157Z","title":"Inception transformer,","venue":null,"work_id":"c2659269-cd69-4e9b-81c9-b65d3163db84","year":2022},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:09.013061Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:a107f55c6851a5ebf73f5a2a2df78c92b3728207b8e6c93c9c229496a62570c1","observation_id":"7ad91af7-83be-49a6-9a73-bc19de038b30","resolution":{"observed_at":"2026-08-11T19:33:10.902466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:10.869334Z","title":"Pay attention to mlps,","venue":null,"work_id":"5b4a54d6-dbbd-482c-9d62-c81bef70564a","year":null},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:09.017652Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:81bad13adfbd0dfdf81f06367f91d532c39a84c8dce3d52ac4e585cd342f0278","observation_id":"58e8c158-a0f4-46c0-b058-998897949334","resolution":{"observed_at":"2026-08-11T19:33:10.879202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:10.851786Z","title":"Mlp-mixer: An all-mlp architecture for vision,","venue":null,"work_id":"5b5e07ba-5a6d-467b-b30b-6bfa6adb54fe","year":2021},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:09.022746Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:354bd572812054b210c15aa80a87eeda0bedf37dfbcef1b38079dcb5e0427300","observation_id":"f5339a8e-65cc-45fd-bba3-85cb20cbf269","resolution":{"observed_at":"2026-08-11T19:33:10.856023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:10.833737Z","title":"Resmlp: Feed- forward networks for image classification with data-efficient training,","venue":null,"work_id":"2374412a-192f-4a73-819e-147456a5952e","year":2022},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:09.026899Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:d1aaf7748296d0d5b0f125de70f3c824581030c3ac9673780c9bc4dbfe329bd3","observation_id":"edde3b16-5899-4a8c-b443-f4f29f6b4e98","resolution":{"observed_at":"2026-08-11T19:33:10.839369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:10.799724Z","title":"Shufflenet v2: Practical guidelines for efficient cnn architecture design,","venue":null,"work_id":"bf19cba1-5472-49af-8956-5f63940e5949","year":2018},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:09.031454Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:99baa48d24b00ce94f6b6476ff5c8dfc792059849731243efe19864d5b85aa6c","observation_id":"fe8409ad-4abb-4bb7-9f3f-eab73da92ada","resolution":{"observed_at":"2026-08-11T19:33:10.807090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:10.775251Z","title":"Moat: Alternating mobile convolution and attention brings strong vision models,","venue":null,"work_id":"147d4271-3f28-4137-b7a1-2f00488f7314","year":2023},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:09.036522Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:77951d45a4b797874b4819e69cb1d8da252f91490af8ab3d469e35744b28e89e","observation_id":"3b036c57-67c3-49b0-88df-ee8f5064aa7b","resolution":{"observed_at":"2026-08-11T19:33:10.780993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:10.745541Z","title":"Batch normalization: Accelerating deep network training by reducing internal covariate shift,","venue":null,"work_id":"60ee5d66-3ec7-4563-b635-3c8860b559da","year":null},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:09.042235Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:4fec8d8682eb71dca3589fa607fd04712de0f72b2a3885bac591f53fe5c1104b","observation_id":"f207e548-e190-410e-88ce-ff782ccfacbf","resolution":{"observed_at":"2026-08-11T19:33:10.751839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-07-06T05:01:27.910364Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-11T19:33:09.047105Z","title":"Gaussian error linear units (gelus),","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:09.047105Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:85b6baac88db55b913604319cdc5b4b1cb2b0e151e765a2c63d20a908941662a","observation_id":"d97791ea-07fd-46d4-ad78-f68d35816897","resolution":{"observed_at":"2026-08-11T19:33:09.047105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-12T08:59:05.030983Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-11T19:33:09.052064Z","title":"Layer normalization,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:09.052064Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:388821cc5f0780c4055213eab984c48644871cf011826ef71ac6ad17487664e6","observation_id":"894c76f9-82e0-46f1-bab7-574b3f42d27c","resolution":{"observed_at":"2026-08-11T19:33:09.052064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:10.725785Z","title":"Imagenet: A large-scale hierarchical image database,","venue":null,"work_id":"d379108c-663c-4a53-8655-54f87b50a120","year":2009},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:09.056904Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:6fca2b97215687d9e8c95f3d886a6474a891f408f6c35e5de278eaf9480efa56","observation_id":"e8a62178-94ae-470f-9605-8e38e2c5a708","resolution":{"observed_at":"2026-08-11T19:33:10.731458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:10.701139Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":"8090d2eb-95b9-4f6b-9021-795ff79dd3ea","year":2019},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:09.061008Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:2755ac5b3662eb297bb5843e54d93c312994cafd680567e583e5b285f91f807b","observation_id":"57fc92c9-d1a3-4d3d-aad8-2b07d4b3bfb5","resolution":{"observed_at":"2026-08-11T19:33:10.708528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:10.672712Z","title":"SGDR: Stochastic gradient descent with warm restarts,","venue":null,"work_id":"151e8877-3f16-4625-8323-5df57d789fb3","year":null},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:09.065269Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:1347b51029910d6c9c43726f7a6f833e44efa7d347b63ab078f5634e44756c93","observation_id":"ad719448-0ba3-43b0-a4e6-4fc178cfbcaf","resolution":{"observed_at":"2026-08-11T19:33:10.684108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:10.649955Z","title":"Rethinking the inception architecture for computer vision,","venue":null,"work_id":"2ae559d1-3c32-442f-9900-639816c0284c","year":2016},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:09.069479Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:d6621813cbe06686e48a000ffc1d887a75bcfa2e5ce74ab3f7c1b0c4ee89fdab","observation_id":"8684aa9d-264d-40d0-bd48-c941080f277d","resolution":{"observed_at":"2026-08-11T19:33:10.657560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:10.602769Z","title":"Deep networks with stochastic depth,","venue":null,"work_id":"698cc8c3-a65e-461a-a13d-1671a308412b","year":2016},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:09.073594Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:a9f60b17e39e6583452b4c3a3031f5433e6d5a10f13622a953b205a5170b6992","observation_id":"baa63e5f-30b8-4daa-9ff7-d511a5d314f1","resolution":{"observed_at":"2026-08-11T19:33:10.623924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:10.584065Z","title":"Randaugment: Practical automated data augmentation with a reduced search space,","venue":null,"work_id":"fc834e3a-c7f8-49cf-a91b-d9bdde217e73","year":null},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:09.078375Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:b1b9367c536f18e324ab2bdb93809872af4f3e2ef6a37aea43db408523c09d4d","observation_id":"042320f6-541c-466e-b4d8-dd8411d8701e","resolution":{"observed_at":"2026-08-11T19:33:10.590744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:10.562095Z","title":"Going deeper with image transformers,","venue":null,"work_id":"7671ad0e-c3c9-4e80-bb0f-d156dfa604fc","year":2021},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:09.083189Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:531cd4615ff860a7478926802184789aaf253b4dec0898852c976bbbe76f57ff","observation_id":"b8afa672-506a-4e7b-b2cb-f96e1bfa5a93","resolution":{"observed_at":"2026-08-11T19:33:10.568617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:10.530248Z","title":"Dropout: a simple way to prevent neural networks from overfitting,","venue":null,"work_id":"402af660-3d61-4748-95bf-3418d19e6861","year":2014},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:09.088459Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:d7f415fd073ceed55c838700ddc37ce54e3b6cd275f353cd2fcb161622764c9e","observation_id":"c9e714b6-8083-4929-bc1e-23725ee1c6e0","resolution":{"observed_at":"2026-08-11T19:33:10.541249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:10.507577Z","title":"mixup: Beyond empirical risk minimization,","venue":null,"work_id":"a1f17569-5e0d-4a82-a8b9-b6c9390dd7bc","year":2018},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:09.093649Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:9ecb37cb57a262a5bd73b6315747c032dcc34cacbd1abb076e1b99dec534752c","observation_id":"18d1dcc5-5954-40cf-945f-0ea0af80b9df","resolution":{"observed_at":"2026-08-11T19:33:10.515981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:10.485201Z","title":"Cutmix: Regularization strategy to train strong classifiers with localizable features,","venue":null,"work_id":"6989f746-2ad8-48a3-8dff-4a29b4288fd0","year":2019},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:09.099815Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:495d6139211b6c9f6a2320bb1843896c441ae363d6c464640a41a9a79aeefba6","observation_id":"33bf2199-9b74-4fc9-bfee-73954325550b","resolution":{"observed_at":"2026-08-11T19:33:10.493164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:10.466119Z","title":"Random erasing data augmentation,","venue":null,"work_id":"6a7c9eba-e9f8-4ba7-84a7-e4affbf183d0","year":2020},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:09.105749Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:3181acd487e9740df684d3c9b87cb0c4cd8338ac6bc5dc611f788fcfd56afee8","observation_id":"30b561b1-19a5-4bd4-932c-afd800402dda","resolution":{"observed_at":"2026-08-11T19:33:10.471017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:10.436658Z","title":"All tokens matter: Token labeling for training better vision transformers,","venue":null,"work_id":"bb1b5876-243e-4e9f-b0e7-0de0492dae2f","year":2021},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:09.111014Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:12d8e84a972dcdf0fd42dd33f3a8cd6a2cdb64c669b7585a1fb66e682fcbb6d7","observation_id":"3119840b-3a8f-4a63-9f7b-63eaaee56d96","resolution":{"observed_at":"2026-08-11T19:33:10.442430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:09.116189Z","title":"Pytorch image models,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:09.116189Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:b4698ef2172ffd8bb0d0351e76cb16a931c76eeca624f4b6ee79030750422c20","observation_id":"01d4d43a-718c-47c0-b2b4-9a604226b8d6","resolution":{"observed_at":"2026-08-11T19:33:09.116189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:10.391898Z","title":"Tresnet: High performance gpu-dedicated architecture,","venue":null,"work_id":"95c8f72e-09fa-4227-8b35-a709e8dcc5dc","year":2021},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:09.120756Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:99143f0eeeab4463d19df3d7ca6f6ccc01fee2078ab40238d6eb3d11ffe8ec14","observation_id":"43f888f2-8d32-43d2-a133-5c8e753c3104","resolution":{"observed_at":"2026-08-11T19:33:10.399510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:10.369409Z","title":"Run, don’t walk: chasing higher flops for faster neural networks,","venue":null,"work_id":"7de27ef3-4126-4d4b-9355-87fa9aff231b","year":2023},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:09.125356Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:315c670e413bba4b653629afb0e4b99daa7c2b0b299aa975dd85a0bfe1f3203e","observation_id":"e360292b-ab38-4b64-92ab-7c9887d2741d","resolution":{"observed_at":"2026-08-11T19:33:10.376257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12635","last_updated":"2022-05-26T13:40:26Z","snapshot_observed_at":"2026-07-06T13:13:44.464408Z","submitted_at":"2022-05-25T10:21:57Z","title":"MoCoViT: Mobile Convolutional Vision Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.12635","snapshot_observed_at":"2026-08-11T19:33:09.129596Z","title":"Mocovit: Mobile convolutional vision transformer,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:09.129596Z"},"links":{"cited_paper":"/paper/2205.12635","citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:a02895c76fd0d23ed022c14b5fc305f713c097af74cce4e5ed73fc2a3db44725","observation_id":"db85b25a-659b-4da1-8527-28afa9548087","resolution":{"observed_at":"2026-08-11T19:33:09.129596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:10.332756Z","title":"Efficientvit: Memory efficient vision transformer with cascaded group attention,","venue":null,"work_id":"25f34b3c-b8b4-402b-b94d-69ff18690dd5","year":2023},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:09.134748Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:64225f35a305aee86bde6604c294ad8107e8f905e8dbe22c6fa5c45f252ba130","observation_id":"daac5484-93a7-4379-86b7-776dbb425025","resolution":{"observed_at":"2026-08-11T19:33:10.354143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:10.311772Z","title":"Mpvit: Multi-path vision transformer for dense prediction,","venue":null,"work_id":"b556f7c3-cf7d-4ca9-95f0-7681bf3fb31f","year":2022},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:09.139328Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:4bfff25e7c2201ba5641fe0352ada693e8b91347a673a055b15eb378e2ea1426","observation_id":"24faf258-60a5-4ef8-927a-48bd188e380d","resolution":{"observed_at":"2026-08-11T19:33:10.317228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14174","last_updated":"2024-05-23T04:59:49Z","snapshot_observed_at":"2026-08-09T04:01:06.867296Z","submitted_at":"2024-05-23T04:59:49Z","title":"Multi-Scale VMamba: Hierarchy in Hierarchy Visual State Space Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14174","snapshot_observed_at":"2026-08-11T19:33:09.144083Z","title":"Multi-scale vmamba: Hierarchy in hierarchy visual state space model,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:09.144083Z"},"links":{"cited_paper":"/paper/2405.14174","citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:cc8dd6c84f2e62350ebb395434684d4a12403252059103cddbf87fcdfaf21c55","observation_id":"063dfb65-5f9b-401b-9606-be7d48e94af5","resolution":{"observed_at":"2026-08-11T19:33:09.144083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07992","last_updated":"2024-05-20T16:36:21Z","snapshot_observed_at":"2026-08-09T20:13:32.035904Z","submitted_at":"2024-05-13T17:59:56Z","title":"MambaOut: Do We Really Need Mamba for Vision?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07992","snapshot_observed_at":"2026-08-11T19:33:09.149397Z","title":"Mambaout: Do we really need mamba for vision?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:09.149397Z"},"links":{"cited_paper":"/paper/2405.07992","citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:bfb19edd96839b22d85cb03fbdc0c89bce381b5b023e32bd65d96e0ccb1333f1","observation_id":"f4e01e62-c4f0-4e4d-b604-710d53478543","resolution":{"observed_at":"2026-08-11T19:33:09.149397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:10.289188Z","title":"Microsoft coco: Common objects in context,","venue":null,"work_id":"70b52e66-ff9d-47c0-a50e-d39f75dc741c","year":2014},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:09.154553Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:578d299ee175bd50a6e3649a046487f7bf61ba9ddae6e3a9e618ee0c2433231d","observation_id":"61065d6f-849c-4e43-9cbf-9c3fc1bc013b","resolution":{"observed_at":"2026-08-11T19:33:10.294337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:33:10.272772Z","title":"Mask r-cnn,","venue":null,"work_id":"82049f76-3fa9-4b74-a2b8-c9e08bcc0274","year":null},"citing_paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-11T19:33:09.159780Z"},"links":{"citing_paper":"/paper/2412.06674"},"observation_digest":"sha256:4e5fa103fc36e2e87b7bbc6c034350396549c6fceaf9702a5effb048c62405d0","observation_id":"0131d5fc-e6ef-4ee5-94de-c487610a00b3","resolution":{"observed_at":"2026-08-11T19:33:10.277774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.06674","last_updated":"2024-12-09T17:12:22Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T19:23:10.528209Z","submitted_at":"2024-12-09T17:12:22Z","title":"EMOv2: Pushing 5M Vision Model Frontier"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":63,"verified_exact":2,"verified_fuzzy":35},"total_outbound_references":117},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 100 of 117 outbound references and 1 inbound Pith citation observation for arXiv:2412.06674."}