|
135 | 135 | #endif |
136 | 136 | vext.8 $IN,$t1,$t1,#8 |
137 | 137 |
|
138 | | - vpmull.p64 $Xl,$H,$IN @ H.lo·Xi.lo |
| 138 | + vpmull.p64 $Xl,$H,$IN @ H.lo·Xi.lo |
139 | 139 | veor $t1,$t1,$IN @ Karatsuba pre-processing |
140 | | - vpmull2.p64 $Xh,$H,$IN @ H.hi·Xi.hi |
141 | | - vpmull.p64 $Xm,$Hhl,$t1 @ (H.lo+H.hi)·(Xi.lo+Xi.hi) |
| 140 | + vpmull2.p64 $Xh,$H,$IN @ H.hi·Xi.hi |
| 141 | + vpmull.p64 $Xm,$Hhl,$t1 @ (H.lo+H.hi)·(Xi.lo+Xi.hi) |
142 | 142 |
|
143 | 143 | vext.8 $t1,$Xl,$Xh,#8 @ Karatsuba post-processing |
144 | 144 | veor $t2,$Xl,$Xh |
|
226 | 226 | #endif |
227 | 227 | vext.8 $In,$t1,$t1,#8 |
228 | 228 | veor $IN,$IN,$Xl @ I[i]^=Xi |
229 | | - vpmull.p64 $Xln,$H,$In @ H·Ii+1 |
| 229 | + vpmull.p64 $Xln,$H,$In @ H·Ii+1 |
230 | 230 | veor $t1,$t1,$In @ Karatsuba pre-processing |
231 | 231 | vpmull2.p64 $Xhn,$H,$In |
232 | 232 | b .Loop_mod2x_v8 |
|
235 | 235 | .Loop_mod2x_v8: |
236 | 236 | vext.8 $t2,$IN,$IN,#8 |
237 | 237 | subs $len,$len,#32 @ is there more data? |
238 | | - vpmull.p64 $Xl,$H2,$IN @ H^2.lo·Xi.lo |
| 238 | + vpmull.p64 $Xl,$H2,$IN @ H^2.lo·Xi.lo |
239 | 239 | cclr $inc,lo @ is it time to zero $inc? |
240 | 240 |
|
241 | 241 | vpmull.p64 $Xmn,$Hhl,$t1 |
242 | 242 | veor $t2,$t2,$IN @ Karatsuba pre-processing |
243 | | - vpmull2.p64 $Xh,$H2,$IN @ H^2.hi·Xi.hi |
| 243 | + vpmull2.p64 $Xh,$H2,$IN @ H^2.hi·Xi.hi |
244 | 244 | veor $Xl,$Xl,$Xln @ accumulate |
245 | | - vpmull2.p64 $Xm,$Hhl,$t2 @ (H^2.lo+H^2.hi)·(Xi.lo+Xi.hi) |
| 245 | + vpmull2.p64 $Xm,$Hhl,$t2 @ (H^2.lo+H^2.hi)·(Xi.lo+Xi.hi) |
246 | 246 | vld1.64 {$t0},[$inp],$inc @ load [rotated] I[i+2] |
247 | 247 |
|
248 | 248 | veor $Xh,$Xh,$Xhn |
|
267 | 267 | vext.8 $In,$t1,$t1,#8 |
268 | 268 | vext.8 $IN,$t0,$t0,#8 |
269 | 269 | veor $Xl,$Xm,$t2 |
270 | | - vpmull.p64 $Xln,$H,$In @ H·Ii+1 |
| 270 | + vpmull.p64 $Xln,$H,$In @ H·Ii+1 |
271 | 271 | veor $IN,$IN,$Xh @ accumulate $IN early |
272 | 272 |
|
273 | 273 | vext.8 $t2,$Xl,$Xl,#8 @ 2nd phase of reduction |
|
291 | 291 | veor $IN,$IN,$Xl @ inp^=Xi |
292 | 292 | veor $t1,$t0,$t2 @ $t1 is rotated inp^Xi |
293 | 293 |
|
294 | | - vpmull.p64 $Xl,$H,$IN @ H.lo·Xi.lo |
| 294 | + vpmull.p64 $Xl,$H,$IN @ H.lo·Xi.lo |
295 | 295 | veor $t1,$t1,$IN @ Karatsuba pre-processing |
296 | | - vpmull2.p64 $Xh,$H,$IN @ H.hi·Xi.hi |
297 | | - vpmull.p64 $Xm,$Hhl,$t1 @ (H.lo+H.hi)·(Xi.lo+Xi.hi) |
| 296 | + vpmull2.p64 $Xh,$H,$IN @ H.hi·Xi.hi |
| 297 | + vpmull.p64 $Xm,$Hhl,$t1 @ (H.lo+H.hi)·(Xi.lo+Xi.hi) |
298 | 298 |
|
299 | 299 | vext.8 $t1,$Xl,$Xh,#8 @ Karatsuba post-processing |
300 | 300 | veor $t2,$Xl,$Xh |
|
0 commit comments